コンテンツへスキップ
MIYA·AI·LAB / 生成AI 実機検証ログ LLM · Claude Code · MLX · Ollama
AI MiyaAILab_
  • // Lab
  • // 全記事
JA / EN
← Miya-Gadget
PC 生成AI

【検証】GTX 1080Tiで最新AI「Qwen 3.5」はどこまで動く?ローカルLLMベンチマーク

2026年3月18日 · Shichinomiya
【検証】GTX 1080Tiで最新AI「Qwen 3.5」はどこまで動く?ローカルLLMベンチマーク

こんにちは、七宮さん(@shichinomiya_s)です。

今回は、2017年発売の名機「NVIDIA GeForce GTX 1080 Ti」で、2026年最新のローカルLLM「Qwen 3.5 9B」がどこまで実用的に動くのか、ガッツリベンチマークを取ってみたお話。

「古いGPUじゃ生成AIなんて無理でしょ?」と思っている方、意外とそんなことないですよ。

Table of Contents

Toggle
  • なぜ古いGPUでローカルLLMを試すのか
  • テスト環境
  • Qwen 3.5とは
  • Q4_K_M(4bit量子化)の結果
  • Q8_0(8bit量子化)の結果
  • 量子化の違いで何が変わる?
  • Thinkingモードの比較
  • VRAM使用量 — 11GBでギリギリ動く
  • 実用性の評価 — ChatGPTの代替になるか?
  • コンテキスト長の限界 — 11GB VRAMでどこまで?
  • まとめ
  • あわせて読みたい

なぜ古いGPUでローカルLLMを試すのか

最近のAIブームで「ローカルで生成AIを動かしたい」という需要が急増しています。でも、最新のRTX 4090やRTX 5090は高い。10万円以上するGPUをAIのためだけに買うのはちょっと…という方も多いはず。

そこで注目したいのが、中古のGTX 1080 Tiです。11GBのVRAMを搭載していて、中古市場では1万円台で手に入ることも。VRAMが多いのはローカルLLMにとって最大の武器なので、「古いけどVRAMが多い」GTX 1080Tiはなかなか面白い選択肢なんです。

正直、ここまで動くとは思いませんでした。結論から言うと、十分実用的に使えます。

テスト環境

項目スペック
GPUNVIDIA GeForce GTX 1080 Ti(11GB VRAM)
CPUAMD Ryzen 9 9950X(16コア/32スレッド)
RAM64GB
OSWindows 11 Pro
LLMランタイムOllama v0.18.1
テストモデルQwen 3.5 9B(Q4_K_M / Q8_0)

ちなみに、筆者のGTX 1080Tiは中古で購入したものです。今でもAmazonで中古品が出回っているので、ローカルAI入門用として意外とアリかもしれません。

Qwen 3.5とは

Qwen 3.5は、Alibaba Cloud(アリババ)が開発した大規模言語モデルです。9Bパラメータのモデルは、比較的軽量ながら日本語性能が高く、コード生成や推論タスクにも強いのが特徴。

Ollamaを使えば、以下のコマンド一発で導入できます。

ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0

今回はQ4_K_M(4bit量子化)とQ8_0(8bit量子化)の2種類を比較しました。量子化とは、モデルのデータを圧縮して軽くする技術のことで、ビット数が小さいほど軽い代わりに精度が若干落ちます。

ローカルLLMを快適に動かすなら、メモリも重要です。64GB以上のメモリを積んでおくと、モデルのロードやマルチタスクが快適になります。

Q4_K_M(4bit量子化)の結果

まずは軽量なQ4_K_M(4bit量子化)から。VRAM使用量は約6.6GB(60%)で、11GBのGTX 1080Tiなら余裕があります。

テスト内容生成速度生成トークン数所要時間
日本語 短文回答
Pythonのリスト内包表記を3文で簡潔に説明してください。
34.7 tok/s1,22735.7秒
日本語 長文生成
Gitのブランチ戦略について、初心者向けに500字程度で解説してください。
34.5 tok/s3,679107.1秒
日本語 要約
機械学習に関する文章を3行で要約
34.6 tok/s1,45942.6秒
コード 簡単な関数
Write a Python function that checks if a string is a palindrome.
34.6 tok/s2,05359.8秒
コード 中程度の関数
Write a Python class implementing a simple LRU cache.
34.6 tok/s3,10790.4秒
コード バグ修正
binary_searchのバグを修正
33.5 tok/s6,335189.9秒
翻訳 日→英
「吾輩は猫である。名前はまだ無い。」を英訳
33.3 tok/s8,191247.0秒
翻訳 英→日
シェイクスピア “To be, or not to be…” を日本語訳
33.7 tok/s4,151123.8秒
推論 論理パズル
AはBより背が高い。CはBより背が低い。DはAより背が高い。一番背が低いのは?
34.7 tok/s1,52944.4秒
推論 数学
1〜100で3の倍数かつ5の倍数の合計は?
34.6 tok/s3,14291.3秒

平均速度は34.4 tok/s。体感的には1秒あたり30文字以上のテキストがスラスラ出てくる感じで、ChatGPTのストリーミング表示よりもやや速い印象です。日本語の回答品質も非常に高く、正直驚きました。

Q8_0(8bit量子化)の結果

次に、より高精度なQ8_0(8bit量子化)。VRAM使用量は約10.0GB(91%)で、11GBのギリギリまで使い切ります。

テスト内容生成速度生成トークン数所要時間
日本語 短文回答
Pythonのリスト内包表記を3文で簡潔に説明してください。
14.6 tok/s1,816125.3秒
日本語 長文生成
Gitのブランチ戦略について、初心者向けに500字程度で解説してください。
14.2 tok/s7,211510.5秒
日本語 要約
機械学習に関する文章を3行で要約
14.6 tok/s1,699116.7秒
コード 簡単な関数
Write a Python function that checks if a string is a palindrome.
14.6 tok/s1,812124.6秒
コード 中程度の関数
Write a Python class implementing a simple LRU cache.
14.4 tok/s3,549246.4秒
コード バグ修正
binary_searchのバグを修正
13.6 tok/s3,768277.2秒
翻訳 日→英
「吾輩は猫である。名前はまだ無い。」を英訳
14.6 tok/s3,197219.6秒
翻訳 英→日
シェイクスピア “To be, or not to be…” を日本語訳
14.2 tok/s5,173365.2秒
推論 論理パズル
AはBより背が高い。CはBより背が低い。DはAより背が高い。一番背が低いのは?
14.6 tok/s1,33091.6秒
推論 数学
1〜100で3の倍数かつ5の倍数の合計は?
14.6 tok/s2,123145.7秒

平均速度は14.3 tok/s。Q4_K_Mと比べると約58%遅いです。体感でも明らかに遅く、長文生成だと8分以上かかるケースも。ただ、1秒に14トークン出ていればリアルタイムで読みながら待つ分には十分使える速度ではあります。

量子化の違いで何が変わる?

Q4_K_MとQ8_0の比較をまとめると、こうなります。

項目Q4_K_M(4bit)Q8_0(8bit)
平均生成速度34.4 tok/s14.3 tok/s
VRAM使用量~6.6 GB(60%)~10.0 GB(91%)
速度差基準-58%
回答品質十分実用的やや高精度

結論としては、GTX 1080TiならQ4_K_M一択です。速度が2.4倍も違うのに、回答品質の差は体感的にほとんどわかりません。Q8_0は「精度を極限まで追求したい」という場合のみ選ぶ感じですね。

VRAMに余裕がある分、Q4_K_Mなら他のアプリケーションを同時に動かしても安定します。一方、Q8_0はVRAMの91%を占有するので、ブラウザでYouTubeを見ながら…みたいな使い方は厳しいかもしれません。

Thinkingモードの比較

Qwen 3.5には「Thinking(思考)モード」があり、回答前に内部で推論プロセスを走らせることができます。FizzBuzzのコード生成タスクで比較してみました。

モデルモードトークン数所要時間速度
Q4_K_MThink有り1,73150.1秒34.7 tok/s
Q4_K_MThink無し1,13332.8秒34.8 tok/s
Q8_0Think有り1,02675.0秒13.7 tok/s
Q8_0Think無し1,674121.2秒13.9 tok/s

Q4_K_Mの場合、Thinkingモードをオンにするとトークン数が約1.5倍に増加し、時間も1.5倍かかります。ただし、生成速度自体はほぼ変わりません。簡単なタスクならThink無しで十分ですが、複雑な推論が必要な場面ではオンにする価値があります。

面白いのはQ8_0の結果で、Think有りの方がトークン数が少なく、時間も短くなっています。これはThinkingモードで内部推論を行うことで、最終的な出力がより簡潔になるケースがあるということですね。

VRAM使用量 — 11GBでギリギリ動く

GTX 1080Tiの11GB VRAMでの使用率をまとめます。

  • Q4_K_M: 約6.6GB使用(60%) → 余裕あり
  • Q8_0: 約10.0GB使用(91%) → ギリギリ

Q4_K_M (6.6GB / 11GB)

Q8_0 (10.0GB / 11GB)

Q4_K_Mなら約4.4GBの余裕があるので、他のGPUタスクとの並行運用も可能です。一方、Q8_0は11GB中10GBを使い切るので、OOM(Out of Memory)エラーのリスクと隣り合わせ。実際のテスト中も、Q8_0では他のアプリケーションを閉じた状態で実行しています。

もし予算に余裕があるなら、RTX 4060 Ti 16GBあたりが現行世代ではコスパ最強です。16GBのVRAMがあれば、より大きなモデルも余裕で動かせます。

実用性の評価 — ChatGPTの代替になるか?

ここまでの結果を踏まえて、GTX 1080Ti + Qwen 3.5 9B(Q4_K_M)の実用性を評価してみます。

向いている用途:

  • プログラミングの補助(コード生成、バグ修正)
  • 日本語の文章作成・要約
  • 翻訳(日英・英日)
  • 論理的な質問への回答
  • プライバシーが気になるデータの処理(すべてローカルで完結)

苦手な用途:

  • 最新の情報が必要な質問(学習データに依存)
  • 画像生成や音声認識(別途モデルが必要)
  • 超長文の一括処理(コンテキスト長の制限あり)

個人的な感想としては、日常的な質問やコーディング補助なら十分ChatGPTの代替になると感じました。34 tok/sという速度はストレスなく使えるレベルですし、何よりAPIの料金を気にせず使い放題なのが大きいです。

月額20ドルのChatGPT Plusを解約して、中古1万円台のGTX 1080Tiでローカルに切り替えるのは、かなりアリな選択肢だと思います。

コンテキスト長の限界 — 11GB VRAMでどこまで?

LLMを実用的に使う上で、「一度にどれだけの文章を処理できるか」(コンテキスト長)も重要なポイントです。Qwen 3.5 9Bはスペック上256Kトークンまで対応していますが、GTX 1080Tiの11GB VRAMではどこまで設定できるのか検証しました。

Q4_K_M(4bit量子化)で num_ctx パラメータを段階的に増やして、安定動作する限界を探った結果がこちらです。

コンテキスト長ロード時間生成速度ステータス
2,048(デフォルト)56.91秒32.9 tok/sOK
4,0963.15秒32.7 tok/sOK
8,1922.63秒32.6 tok/sOK
16,3843.11秒32.8 tok/sOK(推奨)
20,4803.15秒32.4 tok/sOK
24,5763.42秒32.3 tok/sOK(最大安定)
28,672––タイムアウト
32,768––OOM(VRAM不足)

面白い結果になりました。コンテキスト長を変えても生成速度はほぼ一定(32〜33 tok/s)です。つまり、コンテキスト長を増やしても推論速度にはほとんど影響しません。

ただし、24,576(24K)を超えるとタイムアウトやOOM(メモリ不足)が発生します。32Kに設定するとVRAMが完全に足りなくなってエラーになりました。

日常的な使用には16,384(16K)がベストです。論文の要約や長めのコード解析にも十分な長さで、安定性にも余裕があります。24Kも動作しますが、他のアプリケーションとの並行使用を考えると16Kの方が安心です。

ちなみに、初回ロード時(2,048)だけ56秒かかっていますが、これはモデルをVRAMに読み込む時間が含まれているためです。2回目以降は3秒程度でロードが完了します。

ローカルLLMを始めるならこのあたりのパーツがおすすめです。

MSI GeForce RTX 4060 Ti GAMING X 16G
MSI GeForce RTX 4060 Ti GAMING X 16G グラフィックスボード
16GB GDDR6 / ローカルLLM入門に最適な現行GPU

Amazonで見る

※ 価格は変動する場合があります。最新の価格はAmazonでご確認ください。
AMD Ryzen 9 9950X W/O Cooler (16C/32T, 4.3GHz, 170W)
AMD Ryzen 9 9950X W/O Cooler (16C/32T, 4.3GHz, 170W)
¥
93,852
2026/03/18 時点の価格

Amazonで見る

※ 価格は変動する場合があります。最新の価格はAmazonでご確認ください。

まとめ

今回のベンチマークで、GTX 1080Tiでも最新のローカルLLMは十分実用的に動くことがわかりました。

ポイントをまとめると:

  • Q4_K_M(4bit量子化)がベスト — 平均34.4 tok/sで快適に動作
  • Q8_0は速度面で厳しい — 14.3 tok/sで58%遅い
  • VRAM 11GBは9Bモデルに最適 — Q4なら余裕、Q8でもギリギリ動く
  • 日本語品質は高い — Qwen 3.5は日本語タスクで優秀
  • コスパ最強 — 中古1万円台のGPUで実用的なローカルAI環境が手に入る

「ローカルLLMに興味はあるけど、高いGPUは買えない…」という方は、まずGTX 1080Ti + Ollamaから始めてみてはいかがでしょうか。きっと「古いGPUでもここまでできるのか!」と驚くかと思います。

今回使用したRyzen 9 9950Xのような最新CPUとの組み合わせも大事ですが、ローカルLLMではGPUのVRAM容量が最も重要な指標になります。

あわせて読みたい

生成AI関連の検証ログはこちらもどうぞ。

  • 【検証】Tesla V100 32GBでQwen3.8-27Bは動くか?128kコンテキストが1枚に載った実測ベンチマーク
  • 【検証】「LLM API費を50〜80%削減」のTokenTamerを実測 — Pythonは本当に80%減、でも効くのは「再読み込み」だけ
  • Claude CodeでAPI連携!天気予報アプリを作ってみた
  • Claude Codeで作る初めてのプログラム!対話しながらゲームを作ってみた
前の記事 Claude Code Windows版で消せない「nul」ファイルを削除する方法
次の記事 【検証】M1 Pro / M1 MaxでローカルLLMベンチマーク!MLX vs Ollama、Qwen 2.5〜3.5を徹底比較

Related Posts

【検証】AIのAPI代は本当に減らせる?コンテキスト圧縮ツール「Headroom」を導入して実測してみた

【検証】AIのAPI代は本当に減らせる?コンテキスト圧縮ツール「Headroom」を導入して実測してみた

Claude CodeでPDFレポート自動生成!データから綺麗な資料を作成

Claude CodeでPDFレポート自動生成!データから綺麗な資料を作成

Claude Code Windows版で消せない「nul」ファイルを削除する方法

Claude Code Windows版で消せない「nul」ファイルを削除する方法

Claude CodeでAPI連携!天気予報アプリを作ってみた

Claude CodeでAPI連携!天気予報アプリを作ってみた

コメントを残す コメントをキャンセル

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です

七宮さん

七宮さん

PC・ガジェット好きのブロガー。日々の発見を共有しています。

@shichinomiya_s

人気の記事

  • 【検証】Tesla V100 32GBでローカルLLMはどこまで動く?Qwen 3.6実測ベンチマーク — 中古13万円でMoE 98.8 tok/s
  • Claude CodeでPDFレポート自動生成!データから綺麗な資料を作成
  • Claude Codeでメール自動送信!定型業務を完全自動化
  • 【検証】Tesla V100 32GBでQwen3.8-27Bは動くか?128kコンテキストが1枚に載った実測ベンチマーク
  • Claude Codeで本格的なブログシステムを構築!学んだ技術を全て活用

カテゴリー

  • PC
  • おしらせ
  • おでかけ
  • ガジェット
  • レンタルサーバー・VPS
  • 回線
  • 家電
  • 旅行
  • 海外通販
  • 生成AI
  • 自転車
  • 車

MiyaAILab

話題の生成AIを実際に手元で検証する研究ログ。モデル・ツール・サービスを、ベンチマークから実用性まで自分で確かめて発信しています。

Lab

  • AI Lab トップ
  • 生成AI 全記事
  • ← Miya-Gadget 本体

Latest

  • 【検証】Tesla V100 32GBでQwen3.8-27Bは動くか?128kコンテキストが1枚に載った実測ベンチマーク
  • 【検証】Tesla V100 32GBでローカルLLMはどこまで動く?Qwen 3.6実測ベンチマーク — 中古13万円でMoE 98.8 tok/s
  • 【検証】Darkbloomは本当に稼げる?Macを1日放置した収益を大公開!
  • 【検証】「LLM API費を50〜80%削減」のTokenTamerを実測 — Pythonは本当に80%減、でも効くのは「再読み込み」だけ
© 2026 Miya AI Lab — a section of Miya-Gadget. miyagadget.page