まずワークロードから。 次にマシンを選ぶ。
ハードウェアを決める前に、モデルのプロファイルとメモリ要件を比較してください。各ガイドでは、カタログに記載された内容と、まだテストが必要な部分を分けて示します。
12 件のモデルガイド · ソース確認日 2026-09-30
メモリのフィルターは、少なくとも 1 つのランタイムプロファイルに記録されたカタログのしきい値と照合します。未指定のしきい値をゼロとは数えません。1 枚のカードに収まるかどうかや、実測したメモリ使用量を検証するものではありません。 ソースは確認済みです。このグループについて B3IQ のベンチマークは公開していません。
Llama 3.1 8B
チャット / 推論 · Llama 3.1 Community License · ランタイムプロファイル 1 件
チャット、要約、検索を組み合わせた回答に向けたテキストアシスタントのチェックポイント。小さめの Llama デプロイを自分のプロンプトで評価したいときは、ここから始めてください。
- モデルの作成元
- Meta
- カタログの GPU メモリしきい値
- 8 GB
Llama 3.3 70B
チャット / 推論 · Llama 3.3 Community License · ランタイムプロファイル 1 件
Meta の多言語対話向け指示調整テキストモデル。小さめのアシスタントでは品質が足りず、GPU メモリをより多く確保できる場合に評価してください。
- モデルの作成元
- Meta
- カタログの GPU メモリしきい値
- 80 GB
Qwen3 8B
チャット / 推論 · Apache-2.0 · ランタイムプロファイル 2 件
アップストリームで思考モードと非思考モードを持つ、コンパクトな Qwen テキストモデル。ウェイトの占有が控えめで、推論の挙動を比較する出発点に向いています。
- モデルの作成元
- Qwen / Alibaba Cloud
- カタログの GPU メモリしきい値
- 未指定
Qwen3 14B
チャット / 推論 · Apache-2.0 · ランタイムプロファイル 3 件
小さい密モデルと大きい密モデルの中間にある Qwen テキストモデル。大きなマシンを決める前に、自分のアシスタントやコーディングのプロンプトで比較してください。
- モデルの作成元
- Qwen / Alibaba Cloud
- カタログの GPU メモリしきい値
- 記録済みプロファイルで 16~24 GB。他のプロファイルは未指定
Qwen3 32B
チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件
テキスト生成と推論向けの、より大きな密な Qwen モデル。はるかに大きなチェックポイントへ移る前に、もう一つの品質の基準点として試せます。
- モデルの作成元
- Qwen / Alibaba Cloud
- カタログの GPU メモリしきい値
- 32 GB
Qwen3 Coder 30B
チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件
コーディングとツール利用向けに作られた Mixture-of-Experts のチェックポイント。テストの合格や正しいパッチなど、結果を確認できるリポジトリのタスクで評価してください。
- モデルの作成元
- Qwen / Alibaba Cloud
- カタログの GPU メモリしきい値
- 32 GB
gpt-oss 20B
チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件
OpenAI の小さい方のオープンウェイト推論モデル。ツール利用と構造化出力への対応がアップストリームに記載されています。プライベートな推論やエージェントの評価に検討してください。
- モデルの作成元
- OpenAI
- カタログの GPU メモリしきい値
- 24 GB
gpt-oss 120B
チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件
gpt-oss の大きい方の推論チェックポイント。タスクの品質が大きなメモリ予算に見合う場合、特に結果を検証できるツール利用のワークフローで評価してください。
- モデルの作成元
- OpenAI
- カタログの GPU メモリしきい値
- 80 GB
Gemma 3 27B
チャット / 推論 · Gemma Terms of Use · ランタイムプロファイル 1 件
Google の指示調整済み Gemma チェックポイントは、アップストリームでテキストと画像の理解に対応しています。現在のカタログプロファイルはテキストチャットで、画像の提供には別途検証が必要です。
- モデルの作成元
- Google DeepMind
- カタログの GPU メモリしきい値
- 24 GB
Qwen2.5-VL 7B
チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件
画像や視覚的な文書への質問に向けたビジョン言語モデル。抽出精度とグラウンディングを評価する際は、実際に使う画像の種類を使ってください。
- モデルの作成元
- Qwen / Alibaba Cloud
- カタログの GPU メモリしきい値
- 7 GB
BGE-M3
埋め込み · MIT · ランタイムプロファイル 1 件
検索向けの埋め込みモデル。文書とクエリを検索可能な表現に変換します。検索を組み合わせた回答を構築するときは、テキストモデルと組み合わせてください。
- モデルの作成元
- BAAI
- カタログの GPU メモリしきい値
- 未指定
Whisper large-v3
音声からテキスト · Apache-2.0 · ランタイムプロファイル 2 件
文字起こしと音声翻訳向けの音声認識チェックポイント。テキストチャットのエンドポイントではなく、音声のワークフローを提供します。
- モデルの作成元
- OpenAI
- カタログの GPU メモリしきい値
- 6 GB。他のプロファイルは未指定
ガイドは評価の出発点です。
これらのページは、確認済みのアップストリームモデルとカタログのプロファイルを扱います。稼働中の空き容量やテスト済みのデプロイを約束するものではありません。ガイドでワークロードの範囲を決めてから、構成を私たちと確認してください。