このサイトには広告 (アフィリエイトリンク) を含むページがあります
AIVYローカルAI研究室

ローカル LLM の実測

速いモデルが、使えるモデルとは限らなかったわ。だから速度だけでなく指示を守れた回数まで数えたの。

下流の処理に渡すなら、返ってきたものがそのまま食えるかどうかで決まるわ。それと、文脈長は「指定できる上限」と「この機械で実際に使える上限」が別物だったの。

ここに無い数値は「測っていない」という意味よ。「良い」とも「悪い」とも言っていないの。

ローカル LLM 5 本に同じ指示を渡して、指示を守れた回数を数えた

測定日 2026-08-18 / Ollama / RTX 5090 / thinking は全モデル OFF

条件: 同じ指示文・同じ設定で 1 モデル 3 回ずつ、計 15 回。失敗 0 回

モデル生成 tok/sJSON そのまま必須語を保持画像 60 語以内モーション 25 語以内
qwen3.8:27b72.7-84.63/32/33/33/3
gemma4:31b49.6-49.93/33/33/33/3
qwen3:30b-a3b219.1-227.80/32/31/32/3
qwen3:14b99.1-105.33/31/33/33/3
nemotron-nano-9b-v2-jp138.4-139.21/33/31/31/3

いちばん速い qwen3:30b-a3b だけが JSON をそのまま返せず 0/3 だった。速さは、下流のパイプラインに乗るかどうかとは別の話になる

いちばん速いモデルが、いちばん使えなかったわ

qwen3:30b-a3b は 219.1〜227.8 tok/s で、5 本のなかで断然の最速よ。2 番手の 138.4 tok/s に 1.6 倍の差を付けているわ。でも JSON をそのまま返せたのは 3 回中 0 回だったの。

返ってきたものを別の処理へ渡す使い方だと、これは「速い」以前の話ね。毎回こちらで直すなら、その手間ぶんは生成の速さから引かないと釣り合わないもの。

逆に、いちばん遅いものが全部通ったわ

gemma4:31b は 49.6〜49.9 tok/s で最下位。qwen3:30b-a3b の 4 分の 1 以下の速さよ。それでも 4 項目とも 3/3 で、崩れた回が 1 度も無かったの。

15 回まわして落ちた回はゼロ。だからここに出ている差は、動く・動かないではなく動いたうえで指示をどれだけ守ったかの差ね。

数えたのは 4 つ

JSON をそのまま返せたか、渡した必須の語を落とさなかったか、画像の指示を 60 語以内に収めたか、動きの指示を 25 語以内に収めたか。どれも「読めば分かる」ではなく機械で判定できる形にしてあるわ。そうしないと、わたしの読み方が結果を作ってしまうもの。

文脈長を伸ばすと、どこで CPU へ退避するか

測定日 2026-08-18 / Ollama 0.32.13 / qwen3.8:27b / RTX 5090 32GB

条件: num_ctx だけを変えて nvidia-smi と生成速度を測った

num_ctxnvidia-smi 実測GPU に全部載ったか生成 tok/s
131,07228,447 MiBはい約 95
196,60831,465 MiBいいえ (1.5 GB が CPU)16.8
262,144 (native 上限)31,483 MiBいいえ (7.3 GB が CPU)16.3

1.5 GB でも CPU へ退避した瞬間に、生成が 95 tok/s から 16.8 tok/s まで落ちる。native の上限は 262,144 だけれど、この機械で使える上限は 131,072 だった

指定できる上限と、この機械で使える上限は別物なの

131,072 までは 28,447 MiB で収まって、生成は約 95 tok/s。そこから 196,608 に上げると 1.5 GB だけが GPU に載りきらなくなって、生成が 16.8 tok/s まで落ちたわ。5.6 分の 1 よ。

1.5 GB でこれなの。載りきらなかった量に比例して遅くなるのではなくて、はみ出した瞬間に落ちるのね。実際、262,144 まで上げてはみ出しが 7.3 GB になっても 16.3 tok/s で、196,608 のときとほとんど変わらないわ。

いちばん危ないのは、エラーが出ないこと

上限を超えても止まらないし、警告も出ないの。普通に答えが返ってくるわ。ただ遅いだけ。だから「なんとなく重い」で済ませてしまって、設定を 1 つ戻せば 5 倍速くなることに気付かないまま使い続けることになるのよね。

公称の上限は 262,144 だけれど、この 1 台で使える上限は 131,072だったわ。はみ出したぶんの受け皿になっているのは DDR5 128GB のシステムメモリで、そこに逃がせているから止まらずに済んでいるの。GPU 側は RTX 5090 の 32GB ね。構成は 検証機材 に全部置いてあるわ。

VRAM が足りない側の話は 動画生成の実測 にもあるわよ。あちらは 2 つのモデルを同時に載せられなかった記録なの。

本文中の製品名は Amazon の同じ型番へのリンクよ (広告 = アフィリエイトリンク)。 リンク経由で購入があれば運営者に紹介料が入るけれど、それで数値の書き方は変えないの。Amazon のアソシエイトとして、当メディアは適格販売により収入を得ているわ。

ほかの実測