リモート Ollama / 外出先からのアクセス
2 つの「リモート」用途を扱います。① ローカル Inkubus からリモート Ollama(RunPod 等)を使う(GPU が手元に無い)/ ② 外出先から自宅 Inkubus にアクセスする(VPN 推奨)。
01 リモート Ollama(RunPod 等)
ローカルに GPU がない場合、クラウドの GPU インスタンス上で動いている Ollama に接続して Inkubus を使えます。
02 接続手順
- リモート側で Ollama を起動し、公開 URL を取得(例
https://xxxx-11434.proxy.runpod.net)。 - Inkubus の設定画面を開く。
- ラベル(例
RunPod 3090)とベース URL を入力。変更は自動保存されます(保存ボタンはありません)。 - 「接続テスト」でモデル件数が返ることを確認。
接続先は保存され、新規実行時にスナップショットされるので、ライブラリで「どの GPU で走らせたか」が一目で分かります。
Ollama サーバー側の設定。別の PC やクラウドの Ollama に外から接続するには、Ollama を動かす側で次の 2 つを設定して Ollama を再起動します。
OLLAMA_HOST=0.0.0.0 — 全ネットワークインターフェースで待ち受け(既定は localhost のみで、他の端末からは届きません)。
OLLAMA_ORIGINS=* — 接続元を許可。
Ollama がネットワークに開く形になるので、信頼できる LAN か VPN 経由で使ってください。RunPod などの公開プロキシを使う場合は、その案内どおりで自動的に整っていることもあります。
03 接続先の優先順位
- 設定画面で保存した URL(最優先)
OLLAMA_BASE環境変数- ビルトイン
http://localhost:11434
ベース URL に Basic 認証情報を埋め込むと(https://user:pass@host/)そのまま使われます。トークン式(Bearer など)には現時点で未対応です。
04 リモート運用時の制約
- 強制停止: Inkubus 側の接続を切断する方式のため、リモート側の生成プロセスは走り切る可能性があります。GPU を即解放したいときはリモート側で手動停止を。
- ソフト停止(章完了まで待つ)と作品間スリープはそのまま効きます。
05 回線・コストの注意
- ストリーミング中は常時通信が発生します(長文でも実データは数 MB/作品 程度)。従量課金回線では通信量に注意。
- リモート側 Ollama は
keep_aliveを 24 時間に設定しているため、連続バッチ中はモデルがメモリに残ります。逆にバッチ後もしばらく占有するので、時間課金の GPU では注意。
06 打ち切りまでの時間
Inkubus が Ollama への待ち時間で処理を打ち切るのは、リモート接続で小説を生成しているときだけです。ほかの組み合わせでは、どれだけ時間がかかっても待ち続けます。
| 接続先 | 小説の生成 | 一度きりの処理 |
|---|---|---|
自分の PC(localhost / 127.0.0.1 など) | 打ち切らない | 打ち切らない |
| リモート(LAN の別 PC / クラウド) | 設定した時間で打ち切る | 打ち切らない |
「一度きりの処理」とは、キャストの AI 1 画像を読む・AI 2 名前を考える・AI 3 プロフィールを書く のように、1 回のやりとりで結果が返ってくるものです。小説の生成のように途中から再開する仕組みがないため、時間では打ち切りません。時間切れにすると、それまでの待ち時間がまるごと無駄になるからです。
小説の生成は、受信が止まったまま設定した時間が過ぎると打ち切り、何も受け取れていなければ同じ章を自動で再試行します。再開できる作りなので、こちらは時間で見切りをつけたほうが得になります。時間の変更は設定画面の「Ollama 接続先」→「接続の詳細設定」から。いまの接続先でこの設定が効くのかどうかは、その場に表示されます(自分の PC を指している間は「この設定は使われません」と出ます)。
一度きりの処理が返ってこないとき
時間で打ち切らないということは、リモート接続が無言で切れた場合、応答をいつまでも待ち続けるということでもあります。この状態になると、次の生成が「◯◯が実行中のため開始できません」と断られ続けます。
断りのメッセージにはどれくらい待っているかが出ます。10 分を超えると案内が「設定画面の『LLM 排他フラグ』から解放できます」に変わるので、それが目印です。設定画面の「LLM 排他フラグ」を開くと、実行中の処理と経過時間が並んでいて、「強制クリア」で解放できます。
v3.0.0 より前は、上のどの組み合わせにも「5 分」という見えない上限が掛かっていました。自分の PC で使っていても、5 分を超えるキャストの AI は必ず失敗します。設定を 5 分より長くしても、そこで切れていました。v3.0.0 でこの上限を外し、表のとおりの動きに揃えています。
07 トラブル時
- 「接続テスト」で 502 → リモート URL のパス・ポートを再確認。
- モデル一覧が空 → リモート側で
ollama pull <モデル名>済みか確認。 - 生成が途中で切れる → リモート側 / プロキシのアイドルタイムアウトを確認(長文 1 章 = 数分の連続通信に耐えるか)。Inkubus 側の打ち切り時間は 06 打ち切りまでの時間 を参照。
08 外出先からのアクセス
直接インターネット公開はしないでください。Inkubus には認証機構がなく、公開すると世界中の誰でもアクセス可能になります(閲覧・削除・新規実行すべて可能)。
推奨は VPN 経由です。VPN / トンネル側で認証するので、Inkubus 自体の認証欠如をカバーできます。
| 方式 | 特徴 |
|---|---|
| Tailscale | 無料枠で個人利用には十分。端末ごとにアプリを入れるだけ、NAT 越え自動。 |
| WireGuard | 自前構築できるなら軽量で高速。ルーター対応があれば楽。 |
| Cloudflare Tunnel | 独自ドメインがある場合。Cloudflare Access で認証も足せる。 |
VPN 接続中のスマホからは、PC で開いている URL の localhost を自宅 PC の VPN IP に置き替えてアクセスします(ポート番号はそのまま。http://<自宅 PC の VPN IP>:<ポート>)。Inkubus のバッチはサーバプロセスで走り続けるので、VPN を切っても生成は続き、繋ぎ直せば追いつけます。