Loading
Taking longer than expected.
Reload page

まずワークロードから。 次にマシンを選ぶ。

ハードウェアを決める前に、モデルのプロファイルとメモリ要件を比較してください。各ガイドでは、カタログに記載された内容と、まだテストが必要な部分を分けて示します。

12 件のモデルガイド · ソース確認日 2026-09-30

メモリからハードウェアを探す · 適合性の評価方法

メモリのフィルターは、少なくとも 1 つのランタイムプロファイルに記録されたカタログのしきい値と照合します。未指定のしきい値をゼロとは数えません。1 枚のカードに収まるかどうかや、実測したメモリ使用量を検証するものではありません。 ソースは確認済みです。このグループについて B3IQ のベンチマークは公開していません。

Llama 3.1 8B

チャット / 推論 · Llama 3.1 Community License · ランタイムプロファイル 1 件

チャット、要約、検索を組み合わせた回答に向けたテキストアシスタントのチェックポイント。小さめの Llama デプロイを自分のプロンプトで評価したいときは、ここから始めてください。

モデルの作成元
Meta
カタログの GPU メモリしきい値
8 GB
Llama 3.1 8B の要件を読む

Llama 3.3 70B

チャット / 推論 · Llama 3.3 Community License · ランタイムプロファイル 1 件

Meta の多言語対話向け指示調整テキストモデル。小さめのアシスタントでは品質が足りず、GPU メモリをより多く確保できる場合に評価してください。

モデルの作成元
Meta
カタログの GPU メモリしきい値
80 GB
Llama 3.3 70B の要件を読む

Qwen3 8B

チャット / 推論 · Apache-2.0 · ランタイムプロファイル 2 件

アップストリームで思考モードと非思考モードを持つ、コンパクトな Qwen テキストモデル。ウェイトの占有が控えめで、推論の挙動を比較する出発点に向いています。

モデルの作成元
Qwen / Alibaba Cloud
カタログの GPU メモリしきい値
未指定
Qwen3 8B の要件を読む

Qwen3 14B

チャット / 推論 · Apache-2.0 · ランタイムプロファイル 3 件

小さい密モデルと大きい密モデルの中間にある Qwen テキストモデル。大きなマシンを決める前に、自分のアシスタントやコーディングのプロンプトで比較してください。

モデルの作成元
Qwen / Alibaba Cloud
カタログの GPU メモリしきい値
記録済みプロファイルで 16~24 GB。他のプロファイルは未指定
Qwen3 14B の要件を読む

Qwen3 32B

チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件

テキスト生成と推論向けの、より大きな密な Qwen モデル。はるかに大きなチェックポイントへ移る前に、もう一つの品質の基準点として試せます。

モデルの作成元
Qwen / Alibaba Cloud
カタログの GPU メモリしきい値
32 GB
Qwen3 32B の要件を読む

Qwen3 Coder 30B

チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件

コーディングとツール利用向けに作られた Mixture-of-Experts のチェックポイント。テストの合格や正しいパッチなど、結果を確認できるリポジトリのタスクで評価してください。

モデルの作成元
Qwen / Alibaba Cloud
カタログの GPU メモリしきい値
32 GB
Qwen3 Coder 30B の要件を読む

gpt-oss 20B

チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件

OpenAI の小さい方のオープンウェイト推論モデル。ツール利用と構造化出力への対応がアップストリームに記載されています。プライベートな推論やエージェントの評価に検討してください。

モデルの作成元
OpenAI
カタログの GPU メモリしきい値
24 GB
gpt-oss 20B の要件を読む

gpt-oss 120B

チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件

gpt-oss の大きい方の推論チェックポイント。タスクの品質が大きなメモリ予算に見合う場合、特に結果を検証できるツール利用のワークフローで評価してください。

モデルの作成元
OpenAI
カタログの GPU メモリしきい値
80 GB
gpt-oss 120B の要件を読む

Gemma 3 27B

チャット / 推論 · Gemma Terms of Use · ランタイムプロファイル 1 件

Google の指示調整済み Gemma チェックポイントは、アップストリームでテキストと画像の理解に対応しています。現在のカタログプロファイルはテキストチャットで、画像の提供には別途検証が必要です。

モデルの作成元
Google DeepMind
カタログの GPU メモリしきい値
24 GB
Gemma 3 27B の要件を読む

Qwen2.5-VL 7B

チャット / 推論 · Apache-2.0 · ランタイムプロファイル 1 件

画像や視覚的な文書への質問に向けたビジョン言語モデル。抽出精度とグラウンディングを評価する際は、実際に使う画像の種類を使ってください。

モデルの作成元
Qwen / Alibaba Cloud
カタログの GPU メモリしきい値
7 GB
Qwen2.5-VL 7B の要件を読む

BGE-M3

埋め込み · MIT · ランタイムプロファイル 1 件

検索向けの埋め込みモデル。文書とクエリを検索可能な表現に変換します。検索を組み合わせた回答を構築するときは、テキストモデルと組み合わせてください。

モデルの作成元
BAAI
カタログの GPU メモリしきい値
未指定
BGE-M3 の要件を読む

Whisper large-v3

音声からテキスト · Apache-2.0 · ランタイムプロファイル 2 件

文字起こしと音声翻訳向けの音声認識チェックポイント。テキストチャットのエンドポイントではなく、音声のワークフローを提供します。

モデルの作成元
OpenAI
カタログの GPU メモリしきい値
6 GB。他のプロファイルは未指定
Whisper large-v3 の要件を読む

ガイドは評価の出発点です。

これらのページは、確認済みのアップストリームモデルとカタログのプロファイルを扱います。稼働中の空き容量やテスト済みのデプロイを約束するものではありません。ガイドでワークロードの範囲を決めてから、構成を私たちと確認してください。

根拠の基準を読む