先看工作负载。 再选机器。
在决定硬件之前,先比较模型配置和显存要求。每份指南都会区分目录中已有的信息和仍需测试的部分。
12 份模型指南 · 来源审核于 2026-09-30
显存筛选匹配至少一个运行时配置中记录的目录门槛。未指定的门槛不会按零计算。这不能验证单卡是否放得下,也不是实测的显存用量。 来源已审核;本批模型尚未发布 B3IQ 基准测试。
Llama 3.1 8B
对话 / 推理 · Llama 3.1 Community License · 1 个运行时配置
面向对话、摘要和基于检索的问答的文本助手检查点。想用自己的提示评估较小的 Llama 部署时,从这里开始。
- 模型创建者
- Meta
- 目录 GPU 显存门槛
- 8 GB
Llama 3.3 70B
对话 / 推理 · Llama 3.3 Community License · 1 个运行时配置
Meta 面向多语言对话的指令微调文本模型。当较小的助手达不到质量要求、而你能预留更多 GPU 显存时,可以评估它。
- 模型创建者
- Meta
- 目录 GPU 显存门槛
- 80 GB
Qwen3 8B
对话 / 推理 · Apache-2.0 · 2 个运行时配置
紧凑的 Qwen 文本模型,上游提供思考和非思考两种模式。权重占用适中,适合作为比较推理行为的起点。
- 模型创建者
- Qwen / Alibaba Cloud
- 目录 GPU 显存门槛
- 未指定
Qwen3 14B
对话 / 推理 · Apache-2.0 · 3 个运行时配置
介于较小和较大稠密检查点之间的 Qwen 文本模型。在决定更大的机器之前,先用你自己的助手或编码提示比较。
- 模型创建者
- Qwen / Alibaba Cloud
- 目录 GPU 显存门槛
- 各记录配置 16–24 GB;其余配置未指定
Qwen3 32B
对话 / 推理 · Apache-2.0 · 1 个运行时配置
更大的稠密 Qwen 模型,用于文本生成和推理。在转向更大的检查点之前,它提供了另一个可测试的质量档位。
- 模型创建者
- Qwen / Alibaba Cloud
- 目录 GPU 显存门槛
- 32 GB
Qwen3 Coder 30B
对话 / 推理 · Apache-2.0 · 1 个运行时配置
为编码和工具调用构建的混合专家检查点。用结果可验证的仓库任务评估它,例如测试通过或补丁正确。
- 模型创建者
- Qwen / Alibaba Cloud
- 目录 GPU 显存门槛
- 32 GB
gpt-oss 20B
对话 / 推理 · Apache-2.0 · 1 个运行时配置
OpenAI 较小的开放权重推理模型,上游文档说明支持工具调用和结构化输出。可用于私有推理或智能体评估。
- 模型创建者
- OpenAI
- 目录 GPU 显存门槛
- 24 GB
gpt-oss 120B
对话 / 推理 · Apache-2.0 · 1 个运行时配置
更大的 gpt-oss 推理检查点。当任务质量值得更大的显存预算时评估它,尤其是结果可验证的工具调用工作流。
- 模型创建者
- OpenAI
- 目录 GPU 显存门槛
- 80 GB
Gemma 3 27B
对话 / 推理 · Gemma Terms of Use · 1 个运行时配置
Google 的指令微调 Gemma 检查点,上游支持文本和图像理解。当前目录配置为文本对话;图像服务需要单独验证。
- 模型创建者
- Google DeepMind
- 目录 GPU 显存门槛
- 24 GB
Qwen2.5-VL 7B
对话 / 推理 · Apache-2.0 · 1 个运行时配置
用于图像和视觉文档问答的视觉语言模型。评估提取准确性和定位能力时,请使用你实际的图像类型。
- 模型创建者
- Qwen / Alibaba Cloud
- 目录 GPU 显存门槛
- 7 GB
BGE-M3
嵌入 · MIT · 1 个运行时配置
用于检索的嵌入模型。它把文档和查询转换为可搜索的表示;构建基于检索的问答时,与文本模型搭配使用。
- 模型创建者
- BAAI
- 目录 GPU 显存门槛
- 未指定
Whisper large-v3
语音转文字 · Apache-2.0 · 2 个运行时配置
用于转录和语音翻译的语音识别检查点。它服务的是音频工作流,而不是文本对话端点。
- 模型创建者
- OpenAI
- 目录 GPU 显存门槛
- 6 GB;其余配置未指定
指南只是评估的起点。
这些页面覆盖经过审核的上游模型和目录配置,不承诺实时可用或已测试的部署。请先用指南界定你的工作负载,再与我们确认配置。