こんにちは、七宮さん(@shichinomiya_s)です。
今回は、2017年発売の名機「NVIDIA GeForce GTX 1080 Ti」で、2026年最新のローカルLLM「Qwen 3.5 9B」がどこまで実用的に動くのか、ガッツリベンチマークを取ってみたお話。
「古いGPUじゃ生成AIなんて無理でしょ?」と思っている方、意外とそんなことないですよ。
なぜ古いGPUでローカルLLMを試すのか
最近のAIブームで「ローカルで生成AIを動かしたい」という需要が急増しています。でも、最新のRTX 4090やRTX 5090は高い。10万円以上するGPUをAIのためだけに買うのはちょっと…という方も多いはず。
そこで注目したいのが、中古のGTX 1080 Tiです。11GBのVRAMを搭載していて、中古市場では1万円台で手に入ることも。VRAMが多いのはローカルLLMにとって最大の武器なので、「古いけどVRAMが多い」GTX 1080Tiはなかなか面白い選択肢なんです。
正直、ここまで動くとは思いませんでした。結論から言うと、十分実用的に使えます。
テスト環境
| 項目 | スペック |
|---|---|
| GPU | NVIDIA GeForce GTX 1080 Ti(11GB VRAM) |
| CPU | AMD Ryzen 9 9950X(16コア/32スレッド) |
| RAM | 64GB |
| OS | Windows 11 Pro |
| LLMランタイム | Ollama v0.18.1 |
| テストモデル | Qwen 3.5 9B(Q4_K_M / Q8_0) |
ちなみに、筆者のGTX 1080Tiは中古で購入したものです。今でもAmazonで中古品が出回っているので、ローカルAI入門用として意外とアリかもしれません。
Qwen 3.5とは
Qwen 3.5は、Alibaba Cloud(アリババ)が開発した大規模言語モデルです。9Bパラメータのモデルは、比較的軽量ながら日本語性能が高く、コード生成や推論タスクにも強いのが特徴。
Ollamaを使えば、以下のコマンド一発で導入できます。
ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0今回はQ4_K_M(4bit量子化)とQ8_0(8bit量子化)の2種類を比較しました。量子化とは、モデルのデータを圧縮して軽くする技術のことで、ビット数が小さいほど軽い代わりに精度が若干落ちます。
ローカルLLMを快適に動かすなら、メモリも重要です。64GB以上のメモリを積んでおくと、モデルのロードやマルチタスクが快適になります。
Q4_K_M(4bit量子化)の結果
まずは軽量なQ4_K_M(4bit量子化)から。VRAM使用量は約6.6GB(60%)で、11GBのGTX 1080Tiなら余裕があります。
| テスト内容 | 生成速度 | 生成トークン数 | 所要時間 |
|---|---|---|---|
| 日本語 短文回答 Pythonのリスト内包表記を3文で簡潔に説明してください。 | 34.7 tok/s | 1,227 | 35.7秒 |
| 日本語 長文生成 Gitのブランチ戦略について、初心者向けに500字程度で解説してください。 | 34.5 tok/s | 3,679 | 107.1秒 |
| 日本語 要約 機械学習に関する文章を3行で要約 | 34.6 tok/s | 1,459 | 42.6秒 |
| コード 簡単な関数 Write a Python function that checks if a string is a palindrome. | 34.6 tok/s | 2,053 | 59.8秒 |
| コード 中程度の関数 Write a Python class implementing a simple LRU cache. | 34.6 tok/s | 3,107 | 90.4秒 |
| コード バグ修正 binary_searchのバグを修正 | 33.5 tok/s | 6,335 | 189.9秒 |
| 翻訳 日→英 「吾輩は猫である。名前はまだ無い。」を英訳 | 33.3 tok/s | 8,191 | 247.0秒 |
| 翻訳 英→日 シェイクスピア “To be, or not to be…” を日本語訳 | 33.7 tok/s | 4,151 | 123.8秒 |
| 推論 論理パズル AはBより背が高い。CはBより背が低い。DはAより背が高い。一番背が低いのは? | 34.7 tok/s | 1,529 | 44.4秒 |
| 推論 数学 1〜100で3の倍数かつ5の倍数の合計は? | 34.6 tok/s | 3,142 | 91.3秒 |
平均速度は34.4 tok/s。体感的には1秒あたり30文字以上のテキストがスラスラ出てくる感じで、ChatGPTのストリーミング表示よりもやや速い印象です。日本語の回答品質も非常に高く、正直驚きました。
Q8_0(8bit量子化)の結果
次に、より高精度なQ8_0(8bit量子化)。VRAM使用量は約10.0GB(91%)で、11GBのギリギリまで使い切ります。
| テスト内容 | 生成速度 | 生成トークン数 | 所要時間 |
|---|---|---|---|
| 日本語 短文回答 Pythonのリスト内包表記を3文で簡潔に説明してください。 | 14.6 tok/s | 1,816 | 125.3秒 |
| 日本語 長文生成 Gitのブランチ戦略について、初心者向けに500字程度で解説してください。 | 14.2 tok/s | 7,211 | 510.5秒 |
| 日本語 要約 機械学習に関する文章を3行で要約 | 14.6 tok/s | 1,699 | 116.7秒 |
| コード 簡単な関数 Write a Python function that checks if a string is a palindrome. | 14.6 tok/s | 1,812 | 124.6秒 |
| コード 中程度の関数 Write a Python class implementing a simple LRU cache. | 14.4 tok/s | 3,549 | 246.4秒 |
| コード バグ修正 binary_searchのバグを修正 | 13.6 tok/s | 3,768 | 277.2秒 |
| 翻訳 日→英 「吾輩は猫である。名前はまだ無い。」を英訳 | 14.6 tok/s | 3,197 | 219.6秒 |
| 翻訳 英→日 シェイクスピア “To be, or not to be…” を日本語訳 | 14.2 tok/s | 5,173 | 365.2秒 |
| 推論 論理パズル AはBより背が高い。CはBより背が低い。DはAより背が高い。一番背が低いのは? | 14.6 tok/s | 1,330 | 91.6秒 |
| 推論 数学 1〜100で3の倍数かつ5の倍数の合計は? | 14.6 tok/s | 2,123 | 145.7秒 |
平均速度は14.3 tok/s。Q4_K_Mと比べると約58%遅いです。体感でも明らかに遅く、長文生成だと8分以上かかるケースも。ただ、1秒に14トークン出ていればリアルタイムで読みながら待つ分には十分使える速度ではあります。
量子化の違いで何が変わる?
Q4_K_MとQ8_0の比較をまとめると、こうなります。
| 項目 | Q4_K_M(4bit) | Q8_0(8bit) |
|---|---|---|
| 平均生成速度 | 34.4 tok/s | 14.3 tok/s |
| VRAM使用量 | ~6.6 GB(60%) | ~10.0 GB(91%) |
| 速度差 | 基準 | -58% |
| 回答品質 | 十分実用的 | やや高精度 |
結論としては、GTX 1080TiならQ4_K_M一択です。速度が2.4倍も違うのに、回答品質の差は体感的にほとんどわかりません。Q8_0は「精度を極限まで追求したい」という場合のみ選ぶ感じですね。
VRAMに余裕がある分、Q4_K_Mなら他のアプリケーションを同時に動かしても安定します。一方、Q8_0はVRAMの91%を占有するので、ブラウザでYouTubeを見ながら…みたいな使い方は厳しいかもしれません。
Thinkingモードの比較
Qwen 3.5には「Thinking(思考)モード」があり、回答前に内部で推論プロセスを走らせることができます。FizzBuzzのコード生成タスクで比較してみました。
| モデル | モード | トークン数 | 所要時間 | 速度 |
|---|---|---|---|---|
| Q4_K_M | Think有り | 1,731 | 50.1秒 | 34.7 tok/s |
| Q4_K_M | Think無し | 1,133 | 32.8秒 | 34.8 tok/s |
| Q8_0 | Think有り | 1,026 | 75.0秒 | 13.7 tok/s |
| Q8_0 | Think無し | 1,674 | 121.2秒 | 13.9 tok/s |
Q4_K_Mの場合、Thinkingモードをオンにするとトークン数が約1.5倍に増加し、時間も1.5倍かかります。ただし、生成速度自体はほぼ変わりません。簡単なタスクならThink無しで十分ですが、複雑な推論が必要な場面ではオンにする価値があります。
面白いのはQ8_0の結果で、Think有りの方がトークン数が少なく、時間も短くなっています。これはThinkingモードで内部推論を行うことで、最終的な出力がより簡潔になるケースがあるということですね。
VRAM使用量 — 11GBでギリギリ動く
GTX 1080Tiの11GB VRAMでの使用率をまとめます。
- Q4_K_M: 約6.6GB使用(60%) → 余裕あり
- Q8_0: 約10.0GB使用(91%) → ギリギリ
Q4_K_M (6.6GB / 11GB)
Q8_0 (10.0GB / 11GB)
Q4_K_Mなら約4.4GBの余裕があるので、他のGPUタスクとの並行運用も可能です。一方、Q8_0は11GB中10GBを使い切るので、OOM(Out of Memory)エラーのリスクと隣り合わせ。実際のテスト中も、Q8_0では他のアプリケーションを閉じた状態で実行しています。
もし予算に余裕があるなら、RTX 4060 Ti 16GBあたりが現行世代ではコスパ最強です。16GBのVRAMがあれば、より大きなモデルも余裕で動かせます。
実用性の評価 — ChatGPTの代替になるか?
ここまでの結果を踏まえて、GTX 1080Ti + Qwen 3.5 9B(Q4_K_M)の実用性を評価してみます。
向いている用途:
- プログラミングの補助(コード生成、バグ修正)
- 日本語の文章作成・要約
- 翻訳(日英・英日)
- 論理的な質問への回答
- プライバシーが気になるデータの処理(すべてローカルで完結)
苦手な用途:
- 最新の情報が必要な質問(学習データに依存)
- 画像生成や音声認識(別途モデルが必要)
- 超長文の一括処理(コンテキスト長の制限あり)
個人的な感想としては、日常的な質問やコーディング補助なら十分ChatGPTの代替になると感じました。34 tok/sという速度はストレスなく使えるレベルですし、何よりAPIの料金を気にせず使い放題なのが大きいです。
月額20ドルのChatGPT Plusを解約して、中古1万円台のGTX 1080Tiでローカルに切り替えるのは、かなりアリな選択肢だと思います。
コンテキスト長の限界 — 11GB VRAMでどこまで?
LLMを実用的に使う上で、「一度にどれだけの文章を処理できるか」(コンテキスト長)も重要なポイントです。Qwen 3.5 9Bはスペック上256Kトークンまで対応していますが、GTX 1080Tiの11GB VRAMではどこまで設定できるのか検証しました。
Q4_K_M(4bit量子化)で num_ctx パラメータを段階的に増やして、安定動作する限界を探った結果がこちらです。
| コンテキスト長 | ロード時間 | 生成速度 | ステータス |
|---|---|---|---|
| 2,048(デフォルト) | 56.91秒 | 32.9 tok/s | OK |
| 4,096 | 3.15秒 | 32.7 tok/s | OK |
| 8,192 | 2.63秒 | 32.6 tok/s | OK |
| 16,384 | 3.11秒 | 32.8 tok/s | OK(推奨) |
| 20,480 | 3.15秒 | 32.4 tok/s | OK |
| 24,576 | 3.42秒 | 32.3 tok/s | OK(最大安定) |
| 28,672 | – | – | タイムアウト |
| 32,768 | – | – | OOM(VRAM不足) |
面白い結果になりました。コンテキスト長を変えても生成速度はほぼ一定(32〜33 tok/s)です。つまり、コンテキスト長を増やしても推論速度にはほとんど影響しません。
ただし、24,576(24K)を超えるとタイムアウトやOOM(メモリ不足)が発生します。32Kに設定するとVRAMが完全に足りなくなってエラーになりました。
日常的な使用には16,384(16K)がベストです。論文の要約や長めのコード解析にも十分な長さで、安定性にも余裕があります。24Kも動作しますが、他のアプリケーションとの並行使用を考えると16Kの方が安心です。
ちなみに、初回ロード時(2,048)だけ56秒かかっていますが、これはモデルをVRAMに読み込む時間が含まれているためです。2回目以降は3秒程度でロードが完了します。
ローカルLLMを始めるならこのあたりのパーツがおすすめです。
まとめ
今回のベンチマークで、GTX 1080Tiでも最新のローカルLLMは十分実用的に動くことがわかりました。
ポイントをまとめると:
- Q4_K_M(4bit量子化)がベスト — 平均34.4 tok/sで快適に動作
- Q8_0は速度面で厳しい — 14.3 tok/sで58%遅い
- VRAM 11GBは9Bモデルに最適 — Q4なら余裕、Q8でもギリギリ動く
- 日本語品質は高い — Qwen 3.5は日本語タスクで優秀
- コスパ最強 — 中古1万円台のGPUで実用的なローカルAI環境が手に入る
「ローカルLLMに興味はあるけど、高いGPUは買えない…」という方は、まずGTX 1080Ti + Ollamaから始めてみてはいかがでしょうか。きっと「古いGPUでもここまでできるのか!」と驚くかと思います。
今回使用したRyzen 9 9950Xのような最新CPUとの組み合わせも大事ですが、ローカルLLMではGPUのVRAM容量が最も重要な指標になります。







コメントを残す