● 稼働中 費用 ¥0 データは 端末の外に出ません インストール不要

ブラウザを開くだけで、
あなたのPCがあなただけのAIになる。

WebLLM Edge Relay は、WebGPU(@mlc-ai/web-llm)で動く ゼロコスト・プライベートなローカルAI。インストールもDockerも課金もない。 開いて、モデルを選んで、話すだけ。

> ダッシュボードでモデルを選ぶ: Llama-3.2-1B-Instruct-q4f16_1-MLC
> こんにちは
⬇ こ
⬇ ん
⬇ にちわ! …   ← 生成されたのは、あなただけのPCの中で。
Features

専用ソフト不要。クラウド課金なし。
それでも「本物のローカルLLM」。

Ollama のような環境構築も、OpenAI の従量課金も必要ありません。必要なのは、WebGPU対応ブラウザを開いていることだけです。

💸

コスト完全ゼロ

費用はあなたのGPU電気代のみ。クラウドGPUやAPIの従量課金とは無縁です。

🔒

完全プライベート

プロンプトも生成も、端末内のWebGPUだけで処理。外部サーバーへ送信されるデータはゼロ。

⚡

インストール不要

Ollamaのような専用ソフトやDockerは不要。WebGPU対応ブラウザでこのページを開くだけです。

📦

公式全モデル管理

Llama / Qwen / Phi / Gemma / Mistral…事前DL・キャッシュ削除・お気に入り・JSON書き出し/読み込みをダッシュボードで統括。

⏬

その場での自動ダウンロード

未ダウンロードのモデルを選んでも、そのまま自動で取得して推論を開始。進捗%をリアルタイム表示します。

🎛️

ベースシステムプロンプト

一度設定すれば、会話の履歴には出ず、すべてのリクエストに裏方として自動適用。アプリ側の指示とも自然に共存します。

How it works

3ステップで、あなただけのローカルLLM。

ダッシュボードが、あなたのGPUだけで考え、話します。通信先はこのページとモデル配布CDNだけ。

開く

「ダッシュボードを開く」をクリック。インストールも登録もAPIキーも一切不要です。

モデルを選ぶ

Llama / Qwen / Phi / Gemma などから1つ選択。初回は重みが自動ダウンロードされ、進捗%が表示されます。

話すだけ

チャット・要約・翻訳など、そのまま使えます。2回目以降はキャッシュから即起動。

Comparison

Ollama でも クラウドLLM でもない、第三の道。

クラウドLLM
(OpenAI等)
ローカルLLM
(Ollama等)
WebLLM Edge Relay
費用従量課金無料無料
プライバシーデータが外部へローカル完結ローカル完結
セットアップAPIキー発行ソフト導入・環境構築URLを開くだけ
使う場所どこでもそのPCのみWebGPU対応ブラウザならどこでも
モデル切替プロバイダ依存コマンド操作ワンクリック
Documentation

最小限のドキュメント。

始め方・使い方・モデル管理。読むべきものは全部このページにあります。

⚡ すぐ始める3ステップ

  • 1. 開く:上の「ダッシュボードを開く」ボタンから起動します。登録もAPIキーも不要です。
  • 2. モデルを選ぶ:「チャット」タブでモデルを選択。未ダウンロードなら自動で取得が始まり、進捗%が表示されます。
  • 3. 話す:入力欄に書いて送信するだけ。生成はあなたのPCの中で完結します。

💬 チャットの使い方

  • 回答はトークン単位でストリーミング表示されます。
  • 生成中は「停止」でいつでも中断できます。
  • temperature(創造性)などの詳細設定もUIから調整できます。
  • 会話の履歴はこの端末の中にのみ残ります。

📦 モデル管理ダッシュボード

  • 公式全モデルの検索・タグ絞り込み(Llama / Qwen / Phi / Gemma / Mistral…)
  • 手動事前ダウンロード:進捗%とステータスをリアルタイム表示
  • キャッシュ削除:モデル単位の完全削除と容量の再計算
  • お気に入りピン留め/カスタムモデル登録(モデルURL+自動バリデーション)
  • JSONエクスポート/インポート:設定・お気に入り・カスタムモデル一覧を検証付きで移行

🧠 ベースシステムプロンプト

  • 「設定」タブで一度書くだけで、以後のすべての会話に裏方の指示として自動適用されます。
  • 会話の履歴や画面には一切表示されません。
  • 例:「必ず関西弁で答える」「出力は常にMarkdown形式」など、AIの振る舞いを一元的に統一できます。
  • 文字数と推定トークン数をリアルタイム表示し、長すぎる場合は警告します。

💾 ストレージと容量

  • モデルの重み(数百MB〜数GB)はブラウザのキャッシュに保存され、ダウンロードは初回だけです。
  • 使用済み容量と残りの空き容量をダッシュボードに常時表示。
  • 不要なモデルは個別に削除して容量を戻せます。

🔐 プライバシーと安全性

  • プロンプトも生成データも、あなたのPCの中のWebGPUだけで処理。外部に送られる中身はゼロです。
  • 通信するのはこのページの配信元と、モデル重みの配布CDN(初回DL時のみ)だけです。
  • APIキーやアカウント登録は不要。あなただけのAIです。
  • 前提条件: WebGPU 対応ブラウザ(Chrome / Edge 最新版)
FAQ

よくある質問

本当に無料?隠れた課金は?

はい、完全に無料です。推論はあなたのPCのGPUで行い、モデル重みのダウンロードもCDNからの取得で無料です。発生するのは電気代だけです。

インストールや登録は必要ですか?

不要です。WebGPU対応ブラウザ(Chrome / Edge 最新版)でこのページを開き、「ダッシュボードを開く」を押すだけで使い始められます。アカウントもAPIキーもありません。

データは外部に送られませんか?

送られません。入力した内容も生成結果も端末内のWebGPUだけで処理されます。ネットワーク通信は初回のモデル重みダウンロード時にのみ発生します。

ブラウザを閉じたらどうなる?

会話はそこで終了します。ダウンロード済みモデルはブラウザキャッシュに残るので、次回は一瞬で起動します。

どんなモデルが使えますか?

公式対応の全モデル(Llama 3.x、Qwen 2.5/3、Phi、Gemma、Mistral、SmolLM など)に加え、カスタムモデルの登録も可能です。VRAMバッジで端末適合性を確認できます。

重いモデルが動かないのですが?

多くの場合 VRAM 不足です。q4f16_1 量子化や 1B〜3B クラスのモデルからお試しください。Chrome の GPU 状態(chrome://gpu)で WebGPU が有効か確認してください。