Loading
Taking longer than expected.
Reload page

先看工作负载。 再选机器。

在决定硬件之前,先比较模型配置和显存要求。每份指南都会区分目录中已有的信息和仍需测试的部分。

12 份模型指南 · 来源审核于 2026-09-30

按显存查找硬件 · 我们如何评估适配

显存筛选匹配至少一个运行时配置中记录的目录门槛。未指定的门槛不会按零计算。这不能验证单卡是否放得下,也不是实测的显存用量。 来源已审核;本批模型尚未发布 B3IQ 基准测试。

Llama 3.1 8B

对话 / 推理 · Llama 3.1 Community License · 1 个运行时配置

面向对话、摘要和基于检索的问答的文本助手检查点。想用自己的提示评估较小的 Llama 部署时,从这里开始。

模型创建者
Meta
目录 GPU 显存门槛
8 GB
查看要求:Llama 3.1 8B

Llama 3.3 70B

对话 / 推理 · Llama 3.3 Community License · 1 个运行时配置

Meta 面向多语言对话的指令微调文本模型。当较小的助手达不到质量要求、而你能预留更多 GPU 显存时,可以评估它。

模型创建者
Meta
目录 GPU 显存门槛
80 GB
查看要求:Llama 3.3 70B

Qwen3 8B

对话 / 推理 · Apache-2.0 · 2 个运行时配置

紧凑的 Qwen 文本模型,上游提供思考和非思考两种模式。权重占用适中,适合作为比较推理行为的起点。

模型创建者
Qwen / Alibaba Cloud
目录 GPU 显存门槛
未指定
查看要求:Qwen3 8B

Qwen3 14B

对话 / 推理 · Apache-2.0 · 3 个运行时配置

介于较小和较大稠密检查点之间的 Qwen 文本模型。在决定更大的机器之前,先用你自己的助手或编码提示比较。

模型创建者
Qwen / Alibaba Cloud
目录 GPU 显存门槛
各记录配置 16–24 GB;其余配置未指定
查看要求:Qwen3 14B

Qwen3 32B

对话 / 推理 · Apache-2.0 · 1 个运行时配置

更大的稠密 Qwen 模型,用于文本生成和推理。在转向更大的检查点之前,它提供了另一个可测试的质量档位。

模型创建者
Qwen / Alibaba Cloud
目录 GPU 显存门槛
32 GB
查看要求:Qwen3 32B

Qwen3 Coder 30B

对话 / 推理 · Apache-2.0 · 1 个运行时配置

为编码和工具调用构建的混合专家检查点。用结果可验证的仓库任务评估它,例如测试通过或补丁正确。

模型创建者
Qwen / Alibaba Cloud
目录 GPU 显存门槛
32 GB
查看要求:Qwen3 Coder 30B

gpt-oss 20B

对话 / 推理 · Apache-2.0 · 1 个运行时配置

OpenAI 较小的开放权重推理模型,上游文档说明支持工具调用和结构化输出。可用于私有推理或智能体评估。

模型创建者
OpenAI
目录 GPU 显存门槛
24 GB
查看要求:gpt-oss 20B

gpt-oss 120B

对话 / 推理 · Apache-2.0 · 1 个运行时配置

更大的 gpt-oss 推理检查点。当任务质量值得更大的显存预算时评估它,尤其是结果可验证的工具调用工作流。

模型创建者
OpenAI
目录 GPU 显存门槛
80 GB
查看要求:gpt-oss 120B

Gemma 3 27B

对话 / 推理 · Gemma Terms of Use · 1 个运行时配置

Google 的指令微调 Gemma 检查点,上游支持文本和图像理解。当前目录配置为文本对话;图像服务需要单独验证。

模型创建者
Google DeepMind
目录 GPU 显存门槛
24 GB
查看要求:Gemma 3 27B

Qwen2.5-VL 7B

对话 / 推理 · Apache-2.0 · 1 个运行时配置

用于图像和视觉文档问答的视觉语言模型。评估提取准确性和定位能力时,请使用你实际的图像类型。

模型创建者
Qwen / Alibaba Cloud
目录 GPU 显存门槛
7 GB
查看要求:Qwen2.5-VL 7B

BGE-M3

嵌入 · MIT · 1 个运行时配置

用于检索的嵌入模型。它把文档和查询转换为可搜索的表示;构建基于检索的问答时,与文本模型搭配使用。

模型创建者
BAAI
目录 GPU 显存门槛
未指定
查看要求:BGE-M3

Whisper large-v3

语音转文字 · Apache-2.0 · 2 个运行时配置

用于转录和语音翻译的语音识别检查点。它服务的是音频工作流,而不是文本对话端点。

模型创建者
OpenAI
目录 GPU 显存门槛
6 GB;其余配置未指定
查看要求:Whisper large-v3

指南只是评估的起点。

这些页面覆盖经过审核的上游模型和目录配置,不承诺实时可用或已测试的部署。请先用指南界定你的工作负载,再与我们确认配置。

阅读我们的依据标准