コンテンツへスキップ
MIYA·AI·LAB / 生成AI 実機検証ログ LLM · Claude Code · MLX · Ollama
AI MiyaAILab_
  • // Lab
  • // 全記事
JA / EN
← Miya-Gadget
生成AI

【徹底検証】Tesla V100 SXM2を2枚載せる「デュアルNVLink基板」の正体:約10万円でVRAM 64GB・300GB/s環境は実用になるか?

2026年9月17日 · Shichinomiya
【徹底検証】Tesla V100 SXM2を2枚載せる「デュアルNVLink基板」の正体:約10万円でVRAM 64GB・300GB/s環境は実用になるか?

こんにちは、七宮さん(@shichinomiya_s) です。

これまで本ブログでは、Tesla V100 32GBでQwen3.8-27Bを動かす検証や、MoE 35Bを動かす実測ベンチマークなど、エンタープライズ中古GPUを活用した超高コスパなローカルLLM環境を追求してきました。

そんな中、AliExpressの深淵を巡回していたところ、思わず二度見してしまうとんでもない魔改造ボードを発見しました。

それが今回紹介する、「Tesla V100 SXM2 デュアルGPU NVLinkアダプターボード(300GB/s)」です。

Tesla V100 SXM2 デュアルGPU NVLink基板 表面全体

なんと、本来は専用サーバー(DGX-1等)の奥底にマウントされるはずの「Tesla V100 SXM2」を2枚、同一の基板上に直載せし、基板上のPCBトレースでNVLink 2.0(300GB/s)を直結。さらに裏面にPLX PCIeスイッチチップを搭載することで、民生用PCのPCIe x16スロット1本に挿すだけで動いてしまうという、狂気とロマンの結晶のようなアドインカード(AIC)です。

「本当に動くのか?」「冷却はどうする?」「最新LLMは動くのか?」「総額いくらで作れるのか?」——。
中国のハードウェアフォーラム(Taobao、閑魚、Bilibili、CSDN)や海外HPCコミュニティ(r/LocalLLaMA、ServeTheHome)の一次情報を徹底的に洗い出しましたので、その全貌を余すところなくレポートします。


Table of Contents

Toggle
  • 実測サマリー — 1本のPCIeスロットに64GB HBM2と300GB/s NVLinkが載る
  • このカードの正体 — 中国HPC工房「39com」が作ったデュアルSXM2 AIC
  • ハードウェア回路の徹底チェック — なぜPCIe分岐不要で動くのか
    • ① オンボードPLXチップ(PEX8747/8749)による「免拆分」
    • ② 基板内PCB多層配線によるNVLink 2.0(300GB/s)直結
    • ③ 8-pin × 4基(最大600W)の電源と4系統ファン端子
  • なぜ今こんなカードが出回っているのか? — 米Summitスパコン解体と「大船到港」
  • 冷却はどうする? — A100 SXM4用純正ヒートシンク流用術と高静圧ファン
    • ① 最も安くて冷える「A100 SXM4 純正ヒートシンク」流用
    • ② 3Dプリントダクト + 80mm高静圧ファン(38mm厚が本命)
  • 実測性能とベンチマーク — Qwen 32Bで50 tok/s、70Bモデルも64GBに丸載り
  • Voltaの壁を破る救世主「1Cat-vLLM」 — Make Volta Fast Again
  • コスパ比較 — RTX 4090(35万円)やRTX 3090 2枚より圧倒的に優れている点
  • おすすめ構成部品と自作環境の構築
    • ① 電源ユニット(1000W ATX 3.1必須)
    • ② オープンフレームケース & ライザーケーブル
    • ③ SFF-8654(SlimSAS)ケーブル(外付け・別基板タイプ用)
  • 導入前のチェックリストと注意点 — Linux必須、映像出力なし、600Wの熱
  • まとめ — 10万円で「64GB VRAM・NVLink」を手に入れるロマンと実用性
    • 主要パーツ購入リンク一覧
  • あわせて読みたい

実測サマリー — 1本のPCIeスロットに64GB HBM2と300GB/s NVLinkが載る

まずは要点とスペックの結論から整理します。

項目スペック / 実態技術的メリット
搭載GPUTesla V100 SXM2 × 2基16GB×2(計32GB)または 32GB×2(計64GB HBM2)
メモリ帯域各900GB/s(合計 約1.8 TB/s)GDDR6Xを遥かに凌駕するHBM2の圧倒的メモリバス幅
GPU間接続NVLink 2.0 直結(双方向 300 GB/s)PCIe Gen3 x16(約16GB/s)の約18倍。TP=2の通信遅延が極小
ホスト接続PCIe 3.0 x16 スロット ×1PCIe 4.0 / 5.0 スロットでも下位互換でそのまま動作
PCIeスイッチBroadcom / PLX PEX8747(または8749)直載せ「免拆分」=マザーボードのBifurcation(分岐機能)が不要!
電源入力PCIe 8-pin × 4基(最大600W)SXM2の最大TDP 300W×2を外部電源から余裕を持って供給
ファン端子オンボード 4-pin PWM × 4基クーラー用ファンをカード本体から直結給電可能
概算総費用約10万〜11万円(64GB構成時)RTX 4090(24GB・約30万円)の1/3の価格で64GB環境が手に入る

このカードの正体 — 中国HPC工房「39com」が作ったデュアルSXM2 AIC

このボードを手掛けたのは、中国の熱狂的なAIハードウェア開発集団「39com」(および1CATai / 一猫之下のエコシステム)です。

これまではSXM2を1枚だけPCIeに変換する基板が主流でしたが、V100 SXM2の最大の武器である「NVLink」が使えず、単なるPCIe版V100の劣化互換にとどまっていました。
そこで彼らがリバースエンジニアリングによって開発したのが、この「デュアルSXM2+NVLink直結基板」です。

V100 SXM2 NVLink アダプターボード 300GB/s デュアルGPU SXM2×2 → PCIe

V100 SXM2 NVLink アダプターボード 300GB/s デュアルGPU(SXM2×2 → PCIe x8/x8)

¥52,634税込

AliExpressで購入

V100 SXM2 グラフィックスカードアダプター PLX8749 NVLINK Lite デュアルカードボード

V100 SXM2 アダプター PLX8749 NVLINK Lite デュアルカードボード(AI計算向け)

¥42,942税込

AliExpressで購入

V100 SXM2 300G NVLink デュアルGPU アダプター SXM2×2 → PCI-E X8X8

V100 SXM2 300G NVLink デュアルGPU アダプター(SXM2×2 → PCI-E X8X8)

¥49,180税込

AliExpressで購入


ハードウェア回路の徹底チェック — なぜPCIe分岐不要で動くのか

基板の高解像度写真を拡大し、実装されている回路とチップを解析しました。

① オンボードPLXチップ(PEX8747/8749)による「免拆分」

オンボードPLX PCIeスイッチチップ

基板裏面のPCIe金手指のすぐ上に、Broadcom/PLXのPCIeスイッチチップ(PEX8747またはPEX8749)が鎮座しています。
中国の販売ページで「免拆分(No-Bifurcation)」と大々的にアピールされている秘密はここにあります。

通常、1スロットから2枚のGPUを認識させるには、マザーボードのBIOSで「PCIe Bifurcation(x8 + x8分岐)」を有効にする必要があります。しかし、安価なB650マザーやIntel B760マザー、BTOパソコンのマザーボードは分岐に対応していないことが大半です。
このカードはオンボードのPLXスイッチが自前でパケットスイッチングを行うため、どんなマザーボードに挿してもOSから2基の独立したV100として即座に認識されます。

② 基板内PCB多層配線によるNVLink 2.0(300GB/s)直結

基板上オンボードNVLink 2.0等長差動配線

2つのSXM2ソケットの間には、息を呑むほど美しい高密度な蛇行配線(等長差動ペア配線)が整然と走っています。
外付けのNVLinkブリッジやリボンケーブルを挿す必要は一切ありません。カード上にモジュールをネジ止めするだけで、物理的に全6リンク(双方向300GB/s)が自動結線されます。

③ 8-pin × 4基(最大600W)の電源と4系統ファン端子

Tesla V100 SXM2 デュアル基板 裏面スティフナー

上部にはPCIe補助電源8-pinが4つ並んでおり、合計600Wの電力供給に対応。基板右下には冷却ファン用の4-pin PWM端子が4つ装備されています。さらに裏面全体を厚手の金属製スティフナー(バックプレート)が覆っており、重量級クーラーを取り付けても基板がたわまない堅牢な設計になっています。


なぜ今こんなカードが出回っているのか? — 米Summitスパコン解体と「大船到港」

「そもそも、なぜ今さら2017年登場のTesla V100なのか?」と疑問に思う方も多いでしょう。その背景には、国際的なスーパーコンピュータの世代交代劇があります。

米オークリッジ国立研究所で長年世界トップクラスの計算能力を誇っていたスーパーコンピュータ「Summit」が、2024年11月に退役・解体されました。このSummitには、実に約27,648枚の Tesla V100 SXM2 (32GB) が搭載されていました。

これら数万枚のV100モジュールが中古市場に一斉放出され、中国のハードウェア市場に格安で流入したのです(中国ギーク界隈で言う「大船到港(黒船来航)」)。
これにより、32GB HBM2メモリを搭載したモンスターチップが、1枚あたり1.5万〜2万円前後という冗談のような底値で取引される奇跡の相場が生まれました。

Tesla V100 32GB SXM2 GPU モジュール 699-2G503-0203-200

Tesla V100 32GB SXM2 GPU モジュール(699-2G503-0203-200)デュアル構成用

¥140,932税込

AliExpressで購入

NVIDIA Tesla V100 32GB SXM2 PCIE GPU CUDA コンピューティングアクセラレータ

NVIDIA Tesla V100 32GB SXM2 PCIe GPU CUDA コンピューティングアクセラレータ(1枚)

¥120,299税込

AliExpressで購入


冷却はどうする? — A100 SXM4用純正ヒートシンク流用術と高静圧ファン

SXM2モジュールはサーバーラックの超強力なエアフローを前提としており、ヒートシンクもファンも付いていません。自作PC環境で冷やすための定番手法は以下の通りです。

① 最も安くて冷える「A100 SXM4 純正ヒートシンク」流用

コミュニティで最も推奨されているのが、AliExpressやTaobaoで数千円で転がっている「NVIDIA A100 SXM4 純正サーバーヒートシンク」の流用です。
A100とV100 SXM2はネジ穴ピッチが極めて近く、わずかなネジ穴の小加工(またはそのまま)でガッチリと固定できます。極太ヒートパイプと肉厚フィンを備えており、TDP 300Wを余裕で吸収します。

② 3Dプリントダクト + 80mm高静圧ファン(38mm厚が本命)

ヒートシンクに風を当てるため、Thingiverseで無料公開されているシュラウドを3Dプリントし、80mmの高静圧ファンを取り付けます。
ここで普通の静音PCファンを使うと風圧が足りず熱暴走します。サーバー用の38mm厚・10,000RPMファン(SilverStone FHS80Xなど)が本命です。静音性を重視する場合は5,000RPMのARCTIC P8 Maxを補助ファンとして活用します。

SilverStone SST-FHS80X 80mm 38mm 10000RPM 高静圧ファン

SilverStone SST-FHS80X 80×80×38mm 高静圧PWMファン(最大10000RPM / サーバーGPU向け)

¥3,740税込

Amazonで購入

SilverStone SST-FHS80X 80mm 38mm 高静圧ファン 楽天

SilverStone シルバーストーン ケースファン [80mm / 10000RPM] FHS 80X SST-FHS80X

¥4,440税込

楽天で購入

ARCTIC P8 Max 80mm 高静圧 PWMファン

ARCTIC P8 Max 80mm 高静圧PWMファン(500~5000RPM / FDB)

¥1,062税込

Amazonで購入

ARCTIC P8 Max 80mm 高静圧 PWMファン 楽天

ARCTIC P8 Max 80mm 高静圧PWMファン(5000RPM / ACFAN00286A)

¥1,060税込

楽天で購入


実測性能とベンチマーク — Qwen 32Bで50 tok/s、70Bモデルも64GBに丸載り

中国の1CATai公式検証ログおよびRex Yuan氏の実機テストデータによると、2枚のV100 SXM2(計64GB HBM2)をNVLink 300GB/s(Tensor Parallelism: TP=2)で稼働させた推論速度は以下の通りです。

評価モデル並列設定実測デコード速度体感・実用性
Qwen / QwQ-32B単一ストリーム (TP=2)29.9 tokens/s思考モデルが人間の読書速度を余裕で超える
Qwen / QwQ-32B4並列ストリーム (TP=2)50.9 tokens/sバッチ処理でも破綻せずスループット向上
DeepSeek-R1-Distill-Llama-70B単一ストリーム (TP=2)12.7 tokens/s70B巨大モデルが実用的な対話速度で動作
DeepSeek-R1-Distill-Llama-70B4並列ストリーム (TP=2)36.0 tokens/s高負荷時でもNVLink 300GB/sにより帯域飽和なし

通常のPCIeマルチGPU環境では、GPU同士が通信する際にPCIeバス帯域(PCIe 3.0で約16GB/s)がボトルネックとなり、TP=2にすると性能が落ちることがあります。
しかし、本カードは300GB/sというPCIeの18倍の帯域で結ばれているため、GPU間通信のオーバーヘッドがほぼ消滅し、事実上の「巨大な単一64GB GPU」として振る舞います。


Voltaの壁を破る救世主「1Cat-vLLM」 — Make Volta Fast Again

「でもV100ってVolta(sm_70)だから、最新のFlashAttention-2/3が動かないのでは?」

これは自作AI勢なら誰もが突き当たる最大の懸念です。実際、本家vLLMの最新リリースではsm_70の最適化はほぼ放置されています。
この問題を解決するために中国コミュニティが立ち上げたのが、GitHubで公開されている専用フォーク「1Cat-vLLM」(github.com/1CatAI/1Cat-vLLM) です。

1Cat-vLLM: Make Volta Fast Again
Modern LLM inference for NVIDIA Tesla V100 / SM70
  • ハンドチューンされたTurboMind SM70 CUDAカーネル: V100のTensorコアを極限まで駆動する専用カーネル(awq_gemm_sm70)を搭載。
  • AWQ 4-bit推論 & FP8 KVキャッシュ: V100でAWQモデルをフルスピード動作させ、KVキャッシュ圧縮により超長文コンテキストに対応。
  • MoE高速化 & FP16オーバーフロー修正: Qwen 3.5/3.6/3.8 MoEやDeepSeekの推論時に発生するVolta固有のバグを完全解消。

このソフトウェアスタックの存在によって、2017年のGPUでありながら、2026年最新の大規模言語モデルを最前線でぶん回すことが可能になっています。


コスパ比較 — RTX 4090(35万円)やRTX 3090 2枚より圧倒的に優れている点

個人でローカルLLMを運用する際の主要なGPU選択肢と比較しました。

構成VRAM容量メモリ帯域GPU間帯域70Bモデル概算総額
本カード + V100 32GB ×264 GB (HBM2)約1.8 TB/s300 GB/s〇(余裕)約10〜11万円
GeForce RTX 4090 24GB24 GB (GDDR6X)約1.0 TB/sなし×(載らない)約30〜35万円
GeForce RTX 3090 24GB ×248 GB (GDDR6X)約1.8 TB/sPCIe (16〜32GB/s)△(帯域制限)約22〜25万円 (中古)
Mac Studio (M2 Ultra 64GB)64 GB (ユニファイド)800 GB/s–〇約35〜50万円

最大の強みは、「PCIeスロットを1本しか消費しない」という点です。
RTX 3090を2枚挿す場合、マザーボードのスロット間隔、排熱の干渉、巨大ケースの選定などハードルが跳ね上がります。本カードなら、1本のスロットに挿すだけで64GB VRAM環境が手に入ります。


おすすめ構成部品と自作環境の構築

本カードを安定運用するために不可欠な、実績のある推奨周辺パーツをまとめました。

① 電源ユニット(1000W ATX 3.1必須)

V100 SXM2は2枚で最大600Wを消費します。CPUやシステム全体の消費電力を考慮すると、1000W以上の電源が絶対条件です。また、PCIe 8-pinケーブルを分岐なしで独立4本取れるモデルを選んでください。

SUPER FLOWER LEADEX III GOLD 1000W ATX3.1 電源

SUPER FLOWER LEADEX III GOLD 1000W(ATX3.1 / 80PLUS GOLD / フルモジュラー)

¥19,979税込

Amazonで購入

玄人志向 KRPW-GS1000W/90+ ATX3.1 1000W 電源

玄人志向 KRPW-GS1000W/90+(ATX3.1 / 80PLUS GOLD / 1000W / フルプラグイン)

¥15,700税込

楽天で購入

② オープンフレームケース & ライザーケーブル

本カードはカード長が30cmを超え、厚みもヒートシンクとファンで3スロット分を占有します。密閉型ケースよりも、エアフローが完全に抜けるオープンフレームケースでの運用が圧倒的に扱いやすいです。また、垂直配置やマザーボードから離して設置する際はGen4対応の高品質ライザーケーブルを使用してください。

オープンフレーム PCケース 多段重ね対応 ラック型

オープンフレーム PCケース ラック型(多段重ね対応 / ATX・MATX・ITX)

¥3,950税込

Amazonで購入

オープンシャーシ オープンフレーム マイニングフレーム

オープンシャーシ/オープンフレーム マイニングフレーム(ATX / X79 / X99対応)

¥2,680税込

楽天で購入

EZDIY-FAB PCIe 4.0 x16 ライザーケーブル 20cm 90度

EZDIY-FAB PCIe 4.0 x16 ライザーケーブル(20cm / 90度 / 垂直マウント対応)

¥5,799税込

Amazonで購入

EZDIY-FAB PCIe 4.0 x16 ライザーケーブル 20cm

EZDIY-FAB PCIe 4.0 x16 ライザーケーブル(Gen4対応 / 20cm / 90度)

¥7,222税込

楽天で購入

③ SFF-8654(SlimSAS)ケーブル(外付け・別基板タイプ用)

※本記事のAIC直挿し型基板では不要ですが、SlimSASポート経由で外付けケースに引き出すタイプの派生ボードを使う場合は以下のケーブルが必要です。

PCI-E スリムライン SAS4.0 SFF-8654 4i 38pin ケーブル 40cm

PCI-E スリムラインSAS4.0 SFF-8654 4i 38ピン ケーブル(40cm / ホスト→ターゲット)

¥1,399税込

Amazonで購入

Twozoh SFF-8654 to SFF-8654 ケーブル 1m

Twozoh SAS SFF-8654 to SFF-8654 ケーブル(38ピン / 1m / 送料無料)

¥999税込

楽天で購入


導入前のチェックリストと注意点 — Linux必須、映像出力なし、600Wの熱

購入ボタンを押す前に、以下の制約を必ず理解しておいてください。

  1. OSはLinux(Ubuntu 22.04 / 24.04)が原則必須:
    Windowsでも認識自体は可能ですが、PLXスイッチ経由でのP2P NVLink通信や1Cat-vLLMの最適化カーネルはLinux環境が前提です。
  2. 画面出力端子(HDMI/DP)は存在しない:
    サーバー用GPUのため画面出力はありません。CPU内蔵GPU(Intel UHDやRyzenのRDNA内蔵GPU)または画面出力用の安価なグラフィックボードが必要です。
  3. 合計600Wの爆熱:
    冬場は最高の暖房になりますが、夏場はエアコンの効いた部屋での運用が必須です。ファンの風切り音も相当なものになります。

まとめ — 10万円で「64GB VRAM・NVLink」を手に入れるロマンと実用性

今回調査した「Tesla V100 SXM2 デュアルNVLinkアダプターボード」は、まさに中古エンタープライズパーツの旨味と、中国DIYハードウェアの技術力が極限で融合した奇跡のカードでした。

「70Bクラスの最新モデルをローカルで動かしたいけれど、RTX 4090を何枚も買う予算はない」「普通のデスクトップPCの1スロットで大容量VRAMを実現したい」というエンジニアやギークにとって、これ以上魅力的な選択肢は他にありません。

自作とLinuxの知識は必要ですが、それらを乗り越えた先には「約10万円で手に入る64GB HBM2の世界」が待っています。興味のある方はぜひチャレンジしてみてください!

主要パーツ購入リンク一覧

V100 SXM2 NVLink アダプターボード 300GB/s デュアルGPU SXM2×2 → PCIe

V100 SXM2 NVLink アダプターボード 300GB/s デュアルGPU(SXM2×2 → PCIe x8/x8)

¥52,634税込

AliExpressで購入

Tesla V100 32GB SXM2 GPU モジュール 699-2G503-0203-200

Tesla V100 32GB SXM2 GPU モジュール(699-2G503-0203-200)デュアル構成用

¥140,932税込

AliExpressで購入


あわせて読みたい

生成AI関連の検証ログはこちらもどうぞ。

  • Claude Codeでメール自動送信!定型業務を完全自動化
  • Claude CodeでAPI連携!天気予報アプリを作ってみた
  • 【検証】話題のClaude Code用skill「ADHD」は本当に賢くなるのか — 単発と実測対決
  • 【検証】M1 Pro / M1 MaxでローカルLLMベンチマーク!MLX vs Ollama、Qwen 2.5〜3.5を徹底比較
タグ:
  • AI
  • AliExpress
  • GPU
  • HBM2
  • NVLink
  • SXM2
  • Tesla V100
  • vLLM
  • ローカルLLM
  • 自作PC
前の記事 【検証】RTX 4080 32GB改造品の実力:Qwen3.8-27Bの262K・125B MoE・MiniMax H3動画生成を実測レビュー

Related Posts

【検証】AIのAPI代は本当に減らせる?コンテキスト圧縮ツール「Headroom」を導入して実測してみた

【検証】AIのAPI代は本当に減らせる?コンテキスト圧縮ツール「Headroom」を導入して実測してみた

【検証】「LLM API費を50〜80%削減」のTokenTamerを実測 — Pythonは本当に80%減、でも効くのは「再読み込み」だけ

【検証】「LLM API費を50〜80%削減」のTokenTamerを実測 — Pythonは本当に80%減、でも効くのは「再読み込み」だけ

【検証】話題のClaude Code用skill「ADHD」は本当に賢くなるのか — 単発と実測対決

【検証】話題のClaude Code用skill「ADHD」は本当に賢くなるのか — 単発と実測対決

Claude Codeでタスク管理を楽にする!シンプルなTodoリストアプリを作ってみた

Claude Codeでタスク管理を楽にする!シンプルなTodoリストアプリを作ってみた

コメントを残す コメントをキャンセル

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です

七宮さん

七宮さん

PC・ガジェット好きのブロガー。日々の発見を共有しています。

@shichinomiya_s

人気の記事

  • 【検証】Tesla V100 32GBでローカルLLMはどこまで動く?Qwen 3.6実測ベンチマーク — 中古13万円でMoE 98.8 tok/s
  • Claude Codeで賢く買い物!欲しいものの価格を自動監視するツールを作ってみた
  • 【検証】話題のClaude Code用skill「ADHD」は本当に賢くなるのか — 単発と実測対決
  • Claude CodeでAPI連携!天気予報アプリを作ってみた
  • 【検証】「LLM API費を50〜80%削減」のTokenTamerを実測 — Pythonは本当に80%減、でも効くのは「再読み込み」だけ

カテゴリー

  • PC
  • おしらせ
  • おでかけ
  • ガジェット
  • レンタルサーバー・VPS
  • 回線
  • 家電
  • 旅行
  • 海外通販
  • 生成AI
  • 自転車
  • 車

MiyaAILab

話題の生成AIを実際に手元で検証する研究ログ。モデル・ツール・サービスを、ベンチマークから実用性まで自分で確かめて発信しています。

Lab

  • AI Lab トップ
  • 生成AI 全記事
  • ← Miya-Gadget 本体

Latest

  • 【徹底検証】Tesla V100 SXM2を2枚載せる「デュアルNVLink基板」の正体:約10万円でVRAM 64GB・300GB/s環境は実用になるか?
  • 【検証】RTX 4080 32GB改造品の実力:Qwen3.8-27Bの262K・125B MoE・MiniMax H3動画生成を実測レビュー
  • 【検証】Tesla V100 32GBでQwen3.8-27Bは動くか?128kコンテキストが1枚に載った実測ベンチマーク
  • 【検証】Tesla V100 32GBでローカルLLMはどこまで動く?Qwen 3.6実測ベンチマーク — 中古13万円でMoE 98.8 tok/s
© 2026 Miya AI Lab — a section of Miya-Gadget. miyagadget.page