ブラウザを開くだけで、
あなたのPCがあなただけのAIになる。
WebLLM Edge Relay は、WebGPU(@mlc-ai/web-llm)で動く
ゼロコスト・プライベートなローカルAI。インストールもDockerも課金もない。
開いて、モデルを選んで、話すだけ。
> ダッシュボードでモデルを選ぶ: Llama-3.2-1B-Instruct-q4f16_1-MLC > こんにちは ⬇ こ ⬇ ん ⬇ にちわ! … ← 生成されたのは、あなただけのPCの中で。
専用ソフト不要。クラウド課金なし。
それでも「本物のローカルLLM」。
Ollama のような環境構築も、OpenAI の従量課金も必要ありません。必要なのは、WebGPU対応ブラウザを開いていることだけです。
コスト完全ゼロ
費用はあなたのGPU電気代のみ。クラウドGPUやAPIの従量課金とは無縁です。
完全プライベート
プロンプトも生成も、端末内のWebGPUだけで処理。外部サーバーへ送信されるデータはゼロ。
インストール不要
Ollamaのような専用ソフトやDockerは不要。WebGPU対応ブラウザでこのページを開くだけです。
公式全モデル管理
Llama / Qwen / Phi / Gemma / Mistral…事前DL・キャッシュ削除・お気に入り・JSON書き出し/読み込みをダッシュボードで統括。
その場での自動ダウンロード
未ダウンロードのモデルを選んでも、そのまま自動で取得して推論を開始。進捗%をリアルタイム表示します。
ベースシステムプロンプト
一度設定すれば、会話の履歴には出ず、すべてのリクエストに裏方として自動適用。アプリ側の指示とも自然に共存します。
3ステップで、あなただけのローカルLLM。
ダッシュボードが、あなたのGPUだけで考え、話します。通信先はこのページとモデル配布CDNだけ。
開く
「ダッシュボードを開く」をクリック。インストールも登録もAPIキーも一切不要です。
モデルを選ぶ
Llama / Qwen / Phi / Gemma などから1つ選択。初回は重みが自動ダウンロードされ、進捗%が表示されます。
話すだけ
チャット・要約・翻訳など、そのまま使えます。2回目以降はキャッシュから即起動。
Ollama でも クラウドLLM でもない、第三の道。
| クラウドLLM (OpenAI等) | ローカルLLM (Ollama等) | WebLLM Edge Relay | |
|---|---|---|---|
| 費用 | 従量課金 | 無料 | 無料 |
| プライバシー | データが外部へ | ローカル完結 | ローカル完結 |
| セットアップ | APIキー発行 | ソフト導入・環境構築 | URLを開くだけ |
| 使う場所 | どこでも | そのPCのみ | WebGPU対応ブラウザならどこでも |
| モデル切替 | プロバイダ依存 | コマンド操作 | ワンクリック |
最小限のドキュメント。
始め方・使い方・モデル管理。読むべきものは全部このページにあります。
⚡ すぐ始める3ステップ
- 1. 開く:上の「ダッシュボードを開く」ボタンから起動します。登録もAPIキーも不要です。
- 2. モデルを選ぶ:「チャット」タブでモデルを選択。未ダウンロードなら自動で取得が始まり、進捗%が表示されます。
- 3. 話す:入力欄に書いて送信するだけ。生成はあなたのPCの中で完結します。
💬 チャットの使い方
- 回答はトークン単位でストリーミング表示されます。
- 生成中は「停止」でいつでも中断できます。
temperature(創造性)などの詳細設定もUIから調整できます。- 会話の履歴はこの端末の中にのみ残ります。
📦 モデル管理ダッシュボード
- 公式全モデルの検索・タグ絞り込み(Llama / Qwen / Phi / Gemma / Mistral…)
- 手動事前ダウンロード:進捗%とステータスをリアルタイム表示
- キャッシュ削除:モデル単位の完全削除と容量の再計算
- お気に入りピン留め/カスタムモデル登録(モデルURL+自動バリデーション)
- JSONエクスポート/インポート:設定・お気に入り・カスタムモデル一覧を検証付きで移行
🧠 ベースシステムプロンプト
- 「設定」タブで一度書くだけで、以後のすべての会話に裏方の指示として自動適用されます。
- 会話の履歴や画面には一切表示されません。
- 例:「必ず関西弁で答える」「出力は常にMarkdown形式」など、AIの振る舞いを一元的に統一できます。
- 文字数と推定トークン数をリアルタイム表示し、長すぎる場合は警告します。
💾 ストレージと容量
- モデルの重み(数百MB〜数GB)はブラウザのキャッシュに保存され、ダウンロードは初回だけです。
- 使用済み容量と残りの空き容量をダッシュボードに常時表示。
- 不要なモデルは個別に削除して容量を戻せます。
🔐 プライバシーと安全性
- プロンプトも生成データも、あなたのPCの中のWebGPUだけで処理。外部に送られる中身はゼロです。
- 通信するのはこのページの配信元と、モデル重みの配布CDN(初回DL時のみ)だけです。
- APIキーやアカウント登録は不要。あなただけのAIです。
- 前提条件: WebGPU 対応ブラウザ(Chrome / Edge 最新版)
よくある質問
本当に無料?隠れた課金は?
はい、完全に無料です。推論はあなたのPCのGPUで行い、モデル重みのダウンロードもCDNからの取得で無料です。発生するのは電気代だけです。
インストールや登録は必要ですか?
不要です。WebGPU対応ブラウザ(Chrome / Edge 最新版)でこのページを開き、「ダッシュボードを開く」を押すだけで使い始められます。アカウントもAPIキーもありません。
データは外部に送られませんか?
送られません。入力した内容も生成結果も端末内のWebGPUだけで処理されます。ネットワーク通信は初回のモデル重みダウンロード時にのみ発生します。
ブラウザを閉じたらどうなる?
会話はそこで終了します。ダウンロード済みモデルはブラウザキャッシュに残るので、次回は一瞬で起動します。
どんなモデルが使えますか?
公式対応の全モデル(Llama 3.x、Qwen 2.5/3、Phi、Gemma、Mistral、SmolLM など)に加え、カスタムモデルの登録も可能です。VRAMバッジで端末適合性を確認できます。
重いモデルが動かないのですが?
多くの場合 VRAM 不足です。q4f16_1 量子化や 1B〜3B クラスのモデルからお試しください。Chrome の GPU 状態(chrome://gpu)で WebGPU が有効か確認してください。