Loading
Taking longer than expected.
Reload page

什么装得下。 什么能证明。

模型名称和 GPU 显存总量并不是部署测试。我们把来源事实、配置选择和实测数据分开呈现,让你看清一项建议背后的依据。

更新于 2026-09-30 · B3IQ 工程团队

四种证据。

01

上游已记录

发布方的检查点身份、许可证元数据以及预期的输入或输出。每份指南都链接到所审阅的模型卡版本。这证明的是来源的说法,而不是 B3IQ 已经部署了它。

02

目录已配置

确切的运行时配置文件、制品标识符、已配置的上下文、并发数和显存阈值。这些值来自共享模型目录及其硬件配套数据。标签可能变化;未固定版本的制品会被标注。

03

估算

用于早期规划的算术,附带公式和排除项。估算无法证明安装成功、完整上下文能否装下、回答质量或延迟目标。

04

B3IQ 实测

在明确的硬件和软件上可复现的运行,附带工作负载、结果和日期。当前的模型指南不发布 B3IQ 基准测试结果。目录标记或上游分数不能替代运行记录。

显存由多个部分组成。

权重只是开始。推理服务还需要激活值、运行时缓冲区,而对于自回归文本模型,还需要随序列长度和并发请求数增长的 KV 缓存。

同一个检查点在不同的量化、运行时和工作负载设置下,所需显存可能不同。分布在多张卡上的 GPU 显存并不会自动成为一个可用的整体。

仅计权重的算术

参数量(十亿)× 位数 ÷ 8 = 十进制 GB

在 16 位下,每个参数占两个字节。它不包括量化元数据、未量化的层、缓冲区和 KV 缓存。目录中的参数量可能经过四舍五入。

现有的规划助手会加上 20% 并取整到整数 GB。这个预留量是经验法则,而不是针对特定上下文或并发数的测量。小模型的取整可能使其不适用;请使用权重算术并测量完整进程。

机器候选只是起点。

我们通过配置器所用的同一套硬件与定价引擎,把配置文件在目录中的正数显存阈值与商店中可见的配置进行匹配。一台机器出售时所配的 GPU 数量可能多于模型最低显存计算所需。

详情指南会链接到匹配得出的 GPU 数量和配置。当前价格和库存情况以机器页面为准。阈值缺失、商店机型列表未知或不支持的匹配,都不会产生自动推荐。

购买前,请确认运行时支持、精度、GPU 拓扑、CPU/内存、存储以及工作负载的性能目标。没有经过验证的客户路径,任何指南都不会提供部署操作。

发布的基准测试需要什么。

结果必须与某个配置和某个工作负载绑定。在称其为 B3IQ 测量结果之前,我们要求具备以下内容:

  • 模型版本和制品摘要;运行时、驱动程序和相关内核版本。
  • 确切的 GPU 型号和数量、互连、CPU、系统内存和精度。
  • 输入/输出长度或媒体尺寸/时长、批大小、并发数、推理(reasoning)模式设置和预热。
  • 多次重复运行,并保留峰值显存、错误和显存不足(OOM)故障记录。
  • 文本模型的首 Token 时间、Token 间延迟和总吞吐量;嵌入、视觉或音频模型则采用与任务相符的质量和延迟指标。
  • 运行日期、复现步骤、审阅人,以及结果适用范围的明确限制。

社区报告有助于选择测试,但其吞吐量不会作为 B3IQ 的结果呈现。历史结果也不能证明现在有可用容量。

指南如何保持最新。

模型身份和运行时设置保留在共享目录中。商店配置和价格保留在商店中。公开发布记录保存所审阅的来源、原始说明和路由;它不另外维护一张规格表。

目录发现可以提出一个模型。发布则需要经过审阅的身份、来源、访问条款和有用的指导。运行时变更、制品变更和许可证变更都会触发审阅;旧的测试仍附在所测试的版本上。

我们只发布列入允许列表的配置文件。租户模型名称、私有仓库、提示词、节点地址和客户数据不会进入公开页面。

技术参考。