ベンチマーク(モデル・GPU の速度比較)
完了したジョブの実測値から、モデルごと・GPU(接続先)ごとの生成速度を集計して比較する機能です。生成速度の目安が「開発機での参考値」なのに対して、こちらはあなたの環境そのものの実測。使い込むほどデータが貯まり、「どのモデルをどの GPU で走らせるか」の判断材料になります。比較の結果はそのままブログ等に貼れるカード画像として保存できます。
01 どこにある?
ジョブ画面の下部が「ジョブ履歴」と「ベンチマーク」のタブ切替になっています。「ベンチマーク」タブを開くと、それまでに完了したジョブの実測値が自動で集計されます。計測のための特別な操作は不要です — ふだんの生成がそのままベンチマークのデータになります。
接続先(GPU 環境)ごとに集計します。手元の PC とクラウド GPU の結果を混ぜて平均することはありません。プルダウンで環境を切り替えて見比べます。
02 2 つの比較軸 — モデル比較と GPU 比較
上部の切替で、比較の軸を選べます。
- モデル比較(既定)
- 接続先を 1 つ選び、モデルどうしを並べます。「この GPU ではどのモデルがどれだけ速いか」が分かります。プルダウンは接続先の選択になります。
- GPU 比較
- モデルを 1 つ選び、そのモデルを処理したことのある接続先(GPU)どうしを並べます。「同じモデルが、手元の PC とクラウド GPU でどれだけ違うか」が一目で分かります。プルダウンはモデルの選択に切り替わります。
どちらの軸でも、最速の行が濃い色で強調され、順位番号が付きます。並び順は「遅い順(既定)/速い順/名前順」から選べます。遅い順が既定なのは、重い(遅い)モデルほど品質が高い傾向があり、比較の主役になりやすいためです。
03 表示単位 — tok/s(実測)と 字/秒
小説生成のセクションでは、速度の単位を 2 つから選べます。
- tok/s(実測)— 既定
- Ollama が生成のたびに返す実測値(出力トークン数 ÷ 生成時間)です。ベンチマークとして最も正確な数字で、他の LLM ベンチマークとも比べやすい単位です。実測が記録された作品だけを集計します。
- 字/秒
- 出力文字数 ÷ 生成時間で計算します。実測トークンが記録されていない古い作品も含めて表示したいときはこちら。こちらの生成時間にはモデルの初回読み込み(ウォームアップ)やプロンプト処理も含まれるため、tok/s より低めの値になります。「設定して寝るまでの実感速度」に近い数字だと考えてください。
実測トークンの記録は比較的新しい仕組みのため、昔に生成した作品には付いていません。tok/s 表示で件数が少なく感じたら「字/秒」に切り替えてみてください。今後生成する作品にはすべて実測が付くので、使うほど tok/s の母数は増えていきます。
注意: 字/秒は、件数が 1〜2 件しかないモデルだと初回読み込みのぶん実力より遅く見えることがあります(1 件目の生成時間にはモデルのロードが丸ごと入るため)。生成の速いモデルほどこの影響が大きく出ます。正確な速度比較には tok/s(実測)を、件数を増やしてからの字/秒を参考にしてください。
04 5 つのセクション
| セクション | 指標 | 備考 |
|---|---|---|
| 小説生成 | tok/s(実測)または 字/秒 | 物語の長さに左右されない速度指標なので、章数や作品の長さが違っても公平に比較できます。 |
| ひらめき(作品案づくり) | 字/秒(実測が記録されていれば tok/s も) | 実測の記録は途中から入った仕組みです。実測を持つ記録が出てくると、単位の切替ボタンが現れます。 |
| 紹介文(販売用) | tok/s(実測)または 平均時間 | 作品の全文を読ませる処理です。平均時間は原作が長いほど伸びるので、モデルの速さだけを見たいときは tok/s を使ってください。 |
| AI推敲(タイトルの付け直し) | tok/s(実測)または 平均時間 | 同じく全文を読ませます。出す文字数はごく短いので、字/秒は用意していません。 |
| キャスト(AI 1 画像を読む・AI 2 名前を考える・AI 3 プロフィールを書く) | 平均処理時間 | 生成量の目安がない処理のため、速度ではなく平均時間で比較します。v3.3.0 からは横棒で出ます。ほかのセクションと違って棒が短いほど速いので、順位の 01 はいちばん短い棒に付きます。think を OFF にして回した記録は、同じモデルでも別の行になります。 |
紹介文と AI推敲は、実測が記録されるようになったのが新しいため、しばらくは「平均時間」でしか出ないことがあります。tok/s が空のときは切替ボタンで「平均時間」を選んでください。これから作る分には実測が付きます。
05 比較カードを画像で保存
各セクションは、白地に整えたレポートカードとして描画されます。カード右上の「画像を保存」を押すと、高解像度の PNG がダウンロードされます。
- 画像単体で意味が通るよう、比較対象(接続先またはモデル名)・単位・算出式の注記・計測日をカードに焼き込んでいます。ブログや SNS にそのまま貼れます。
- アプリのテーマ(ダーク/ライト)に関わらず、保存されるカードは常に同じ見た目です。
- 保存はセクションごとです。「小説生成だけ」「GPU 比較の 1 枚だけ」のように、記事の文脈に合わせて使えます。
- 行をしぼって保存できます: ツールバーの「表示」ボタンで、比較したい行だけを残せます(外した行はカードにも保存画像にも出ません)。隠している間は「表示 3/9」のような表記とカード下の案内が出て、リロードすると全表示に戻ります。
06 接続先ラベルとの関係
ベンチマークの「GPU」の正体は、設定画面で付ける接続先ラベルです。クラウド GPU を使うたびにラベルを手打ちしていると、同じ GPU なのに表記が揺れて(例: 型番だけ・型番+サービス名)、集計の行が分かれてしまうことがあります。
そのときは設定画面の「接続先ラベル」タブで名前を統合すると、過去の記録ごとまとまり、ベンチマークの行も揃います。各ラベルの「ベンチマーク」ボタンから、その接続先の集計へ直接ジャンプすることもできます。
07 よくある疑問
- 件数(N 作品)が思ったより少ない
- 表示している件数は「その指標の計算に使えた件数」です。実測トークンや生成時間の記録は途中のバージョンから加わった仕組みのため、古い作品は集計に入りません。故障ではなく、使うほど増えていきます。
- 同じモデルなのに数値がページの目安と違う
- 生成速度は GPU(とくに VRAM に収まるかどうか)・文脈サイズ・モデルの量子化で大きく変わります。生成速度の目安は開発機の参考値、ベンチマークはあなたの環境の実測です。違って当然で、だからこそ実測に価値があります。
- 環境をまたいだ合計や平均は見られる?
- 意図的に用意していません。GPU が違う結果を混ぜると数字の意味がなくなるためです。GPU 比較の軸で「並べて」見比べてください。