生成AI / Generative-AI

生成AI のログ

> 23 entries logged

【検証】RTX 4080 32GB改造品の実力:Qwen3.8-27Bの262K・125B MoE・MiniMax H3動画生成を実測レビュー

中国市場で流通するRTX 4080の32GB改造品を実機検証。Qwen3.8-27BのQ8_0が全層GPUに収まり22.47 tok/s、ネイティブ262,144トークンもKV q8_0により26,240MiBで動作。生成速度はTesla V100 32GBと同等ながらprefillは最大3.2倍。125B MoE(Qwen3.8-Flash-Next)のCPU併用やMiniMax H3動画生成、16GB/24GB制限時の挙動まで詳しく測定しました。

【検証】AIのAPI代は本当に減らせる?コンテキスト圧縮ツール「Headroom」を導入して実測してみた

AIエージェントのトークン消費を最大95%削減すると謳うOSS「Headroom」を実際にMacへ導入し、ログ・JSON・コード・RAGの4種データで実測。コード79.8%・JSON59.2%・ログ31.0%削減、多段デバッグセッション全体では47.5%削減を確認しました。導入手順から仕組み、コスト試算、向き不向きまで正直にレビューします。