Local LLM · RTX PRO 6000 Blackwell · 192GB VRAM · 2026-09
RTX 5090の上、 GeForceの構成では届かない領域を予算600万円以内で組むと、答えはひとつにほぼ絞られます。NVIDIA RTX PRO 6000 Blackwell(96GB)を2枚。VRAM合計192GBで、Qwen3-235Bのような大型MoEモデルやLlama 405B級まで自宅の机の上で動くマシンになります。このページは、その部品表・選定理由・電気と運用の落とし穴をまとめた設計図です。
予算を段階的に下げる構成(5090×2/3090×2)はローカルAIを回すPCの選び方と中古RTX 3090 PCの探し方に分けてあります。このページは「上限側」を扱います。
結論(2026年9月の価格から)
RTX PRO 6000 Blackwell 96GBが1枚約230〜250万円(米国価格$16,000前後)。2枚で約480万円。残りの予算でThreadripperプラットフォームを組むと総額およそ560〜590万円で、VRAM 192GB・メモリ帯域3.6TB/sのマシンが完成します。5090×2(64GB)と比べて3倍のVRAM、データセンター向けカード(H100等)と比べて普通のPCケースに収まり、GeForceドライバで素直に動く、「個人が買える」の上限にあたる構成です。
2026年9月の国内流通価格(正規代理店・並行輸入とも)で、送料・消費税込みの目安で積算しています。
| 部品 | 具体的な選択 | 価格の目安 |
|---|---|---|
| GPU | NVIDIA RTX PRO 6000 Blackwell 96GB ×2 (PNY・Leadtek等の正規版。ワークステーション向け2スロットカード、各400W、12V-2x6ケーブル1本/枚) | 約230〜250万円 ×2 = 約460〜500万円 |
| CPU | AMD Ryzen Threadripper 7970X(32コア) PCIe 5.0 レーン128本。GPU2枚にx16/x16を渡せるのが選定理由 | 約50万円 |
| マザーボード | TRX50チップセット(ASUS Pro WS TRX50-SAGE 等) 7スロット界隈でカード間隔が取りやすいSAGE系が定番 | 約12〜15万円 |
| メモリ | DDR5 RDIMM 128GB(4×32GB) MoEモデルの専門家をCPU側に逃がすときの受け皿 | 約12〜15万円 |
| 電源 | 1600〜1700W ATX 3.1(12V-2x6ポート対応) GPU2枚+CPUで最大瞬間1.2kW超。連続運用なら1600Wが下限 | 約7〜9万円 |
| ストレージ | NVMe SSD 4TB(システム+モデル置き場) 235B級のGGUFは1本130GB超。モデル専用に2TB追加もあり | 約6〜8万円 |
| ケース・冷却 | 高静音フルタワー(Fractal Define 7 XL 等)+簡易水冷360mm エアフローの取れる大きいケースが最優先 | 約5〜7万円 |
| 合計 | — | 約560〜590万円 |
GPU2枚の総額がボディの8割を占めます。ここが2025年の発売直後(1枚約130万円)と比べて約1.8倍に高騰しているため、600万円に収まっているのはぎりぎりのラインです。逆に言えば、この価格帯が落ちてくれば同じ構成が450万円程度まで下がります。
「5090より上」を買おうとすると、選択肢はプロ向けかデータセンター向けに二分されます。
| 候補 | VRAM(枚) | この構成での評価 |
|---|---|---|
| RTX PRO 6000 Blackwell | 96GB | 本命。GeForceと同じドライバで動き、2スロット・400Wで普通のケースに収まる。ECC付きGDDR7で帯域1.79TB/s |
| RTX 6000 Ada / A6000(中古) | 48GB | 次点。2枚で96GB。総額は半額以下だが、235B級は載らない |
| H100 80GB(中古) | 80GB | 不向き。2枚で400万円超・SXM/PCIeの取り回しが特殊で、blowerファン・専用電源・騒音が実用の壁 |
| A100 80GB(中古) | 80GB | 不向き。同上。1枚100万円でも周りに金がかかる |
| RTX 5090 ×2 | 32GB | 代替。64GB・総額80万円以下と圧倒的に安いが、載るモデルが一段落ちる |
データセンター向けカードは「VRAMあたりの単価」では勝っていても、冷却・電源・ドライバ・設置の4つ全部で個人には不利です。RTX PRO 6000はワークステーション向け、つまり「机の上で仕事をする前提」で作られたカードなので、この4つが全部GeForce並みに素直、というのが決め手です。
| モデル(例) | サイズの目安 | 192GBリグで |
|---|---|---|
| Qwen3-235B-A22B 系(MoE)Q4_K_M | 約130〜140GB | 載る。動く専門家が22B分なので、235Bにしては速い。この構成の主役 |
| Llama-3.1-405B 系 Q3 | 約170GB | ぎりぎり載る。Q4(約230GB)ははみ出す |
| 70B 級(密モデル)Q8/fp16 | 約75GB/約141GB | 余裕を持って載る。無検閲(abliterated)版の70Bを高精度量子化で |
| DeepSeek-R1 / V3 系(671B MoE)Q2_K | 約200GB超 | はみ出す。Q1やiq系の超圧縮なら届くが品質とのトレード |
| 27〜32B 級(無検閲版の主力) | 約16〜20GB | 当然ながら余裕。文脈を10万トークン以上取っても余る |
トークン生成速度は「メモリ帯域の合計 ÷ 1トークンあたりの読み込み量」で決まります。2枚合計の帯域は約3.6TB/s。MoEのQwen3-235B-A22B(1トークンで約22B分=Q4で約13GBを読む)なら理論上限で毎秒270トークン強。ただしこれはvLLMなどのテンソル並列で2枚を同時に働かせた場合の数字です。llama.cppの標準(モデルの層を2枚に分けて順番に通す方式)では、1つの会話の速さは1枚分の帯域(1.79TB/s)が上限になり、約135トークンです。実際はその2〜4割落ちとしても、読む速度を大きく上回る水準です。この見積もりは公開仕様からの計算で、本稿では実機ベンチマークをしていません。
| 予算 | 構成の中心 | VRAM | 載るモデルの上限 |
|---|---|---|---|
| 約580万円 | 本ページ:PRO 6000 96GB ×2 | 192GB | Qwen3-235B Q4/405B Q3 |
| 約300万円 | PRO 6000 96GB ×1 | 96GB | 70B fp16/235B Q2級 |
| 約90万円 | RTX 5090 32GB ×2 | 64GB | 70B Q4/MoEなら120B級 |
| 約50万円 | 予算50万円の4ルートで比較(V100 32GB/3080 20GB改造×2/中古RTX 3090 ×2/EVO-X2) | 32〜48GB | 27B高速 or 70B Q4(→3090の探し方) |
| 約24万円 | 中古3090搭載PC | 24GB | 27〜32B Q4(→pc3090) |
どの段でも「今載せたいモデルが決まっているなら、そのモデルのQ4_K_Mのサイズ+文脈分+2割」で必要VRAMを出し、一段上の構成を買う、が失敗しない選び方です。
3090単体が約20万円で安定した今、3090×2(48GB)は「万能だが予算いっぱい・状態選びが命」の一案でしかなくなりました。2026年9月時点の相場で、目的別に載せ替えた比較です。速度は理論値・公開実測の混ざった目安です。
| ルート | 概算 | メモリ | 27B Q4速度 | 70B Q4 | 動画生成 | 一言 |
|---|---|---|---|---|---|---|
| ① V100 32GB (シロッコファン付きSXM2変換) | 15〜35万円 | 32GB HBM2 900GB/s | 70tok/s近く | 載らない(40GB) | 不可 | 会話特化の最速コスパ。CUDA 12.x縛り(CUDA 13でVolta外れた)と、LLM以外のエコシステムが無いのが条件。SXM2は変換基板+ファンシュラウド前提。PCIe版は倍額なのでシロッコ付きSXM2が本命 |
| ② 3080 20GB 改造 ×2 | 25〜28万円 | 40GB GDDR6X 760GB/s ×2 | 余裕 | ぎり載る | 苦しい(20GB×2) | 4090級クーラーに載せ替えた個体が多く状態は3090の焼け個体よりマシことが多い。ただ国内流通は月数件で「選べる」市場ではない。保証なし・320W/枚 |
| ③ 中古RTX 3090 ×2 | 50〜52万円 | 48GB GDDR6X 936GB/s ×2 | 余裕 | 載る | 可(+メモリ64GB推奨) | LLMも動画も、の万能策。マイニング全盛期のボードでへたり個体が多いのが最大のリスク(→状態の見極め方はpc3090) |
| ④ EVO-X2 RAM64 (Ryzen AI Max+ 395) | 約35万円 | 64GB統合 256GB/s | 10〜15tok/s | 約5tok/s | 弱い | 大MoEを載せて寝かせる専用機。gpt-oss-120bが実用速度(128GB版で32tok/s・235Bで11tok/sの報告)。CUDAを捨てる(ROCm/Vulkan)。10cm角・静音・30W台は代替なし |
選び方の結論:無検閲27Bの会話を最速で回すのが目的なら①V100。LLMと動画生成(Wan系)の両方なら③3090×2しかない。大型MoEをRAGやエージェントで常時回すなら④EVO-X2。②は「V100が取れないときの次善」で、浮いた予算をストレージとメモリに回すのが正しい使い方です。
V100を買うときの注意
SXM2品はパッシブ冷却なのでシロッコ(ブロア)ファン付きシュラウドへの載せ替えが必須(変換キット・3Dプリント品が出回っています)。llama.cppはCUDA 12.x系ビルドで安定運用。fp16テンソルコアしか無いのでFlash Attention系の最適化は当てにしないこと。電源は250W/枚で普通のPCIe 8pin運用が可能です。
追記(2026-09-23):Qwen4-27Bを見据えるなら
雲棲大会(2026年9月22〜24日)でAlibabaがQwen4シリーズ(Max/Plus/Flash/27B)を発表しました。27Bはまだ未リリースでスペックは未公表ですが、直近の27B系(Qwen3.6-27B:Q4で約19GB・Q8で約30GB)から読める備え方は明確です。無検閲化(abliterated)版は刈り込みで地頭が少し落ちるぶん、Q5/Q6以上の高量子化で運用したい——つまり「Q4が載れば足りる」ではなくQ6+長文脈まで載るVRAMが適正で、32GB(V100/5090)がQ4快適ライン、40〜48GB(3080 20GB×2/3090×2)が高量子化+長文脈の適正です。27B系を主戦場にするなら梯子の1段上を買う根拠がもうひとつ増えました。もしQwen4-27BがMoE化(次世代アーキのプレビューとされるFlash-Next型)した場合は総サイズが跳ねる可能性があり、そのときは④EVO-X2(128GB版)や最上位リグの守備範囲になります。
[PR] ここからのリンクはAmazonアソシエイト・楽天アフィリエイト(A8.net経由)のリンクです。経由して購入されると当サイトに紹介料が入りますが、あなたの支払額は変わりません。いずれも検索結果へのリンクで、特定の商品を推しているわけではありません。
GPU本体はAmazon・楽天の一般検索では入手できないため、アフィリエイトリンクには含めていません。代理店・専門店での購入になります。