先看工作負載。 再選機器。
在決定硬體之前,先比較模型設定和記憶體需求。每份指南都會區分目錄中已有的資訊和仍需測試的部分。
12 份模型指南 · 來源審核於 2026-09-30
記憶體篩選會比對至少一個執行環境設定中記錄的目錄門檻。未指定的門檻不會以零計算。這不能驗證單卡是否放得下,也不是實測的記憶體用量。 來源已審核;本批模型尚未發布 B3IQ 基準測試。
Llama 3.1 8B
對話 / 推論 · Llama 3.1 Community License · 1 個執行環境設定
面向對話、摘要和基於檢索的問答的文字助理檢查點。想用自己的提示詞評估較小的 Llama 部署時,從這裡開始。
- 模型建立者
- Meta
- 目錄 GPU 記憶體門檻
- 8 GB
Llama 3.3 70B
對話 / 推論 · Llama 3.3 Community License · 1 個執行環境設定
Meta 面向多語言對話的指令微調文字模型。當較小的助理達不到品質要求、而你能預留更多 GPU 記憶體時,可以評估它。
- 模型建立者
- Meta
- 目錄 GPU 記憶體門檻
- 80 GB
Qwen3 8B
對話 / 推論 · Apache-2.0 · 2 個執行環境設定
精簡的 Qwen 文字模型,上游提供思考和非思考兩種模式。權重佔用適中,適合作為比較推論行為的起點。
- 模型建立者
- Qwen / Alibaba Cloud
- 目錄 GPU 記憶體門檻
- 未指定
Qwen3 14B
對話 / 推論 · Apache-2.0 · 3 個執行環境設定
介於較小和較大稠密檢查點之間的 Qwen 文字模型。在決定更大的機器之前,先用你自己的助理或程式撰寫提示詞比較。
- 模型建立者
- Qwen / Alibaba Cloud
- 目錄 GPU 記憶體門檻
- 各記錄設定 16–24 GB;其餘設定未指定
Qwen3 32B
對話 / 推論 · Apache-2.0 · 1 個執行環境設定
更大的稠密 Qwen 模型,用於文字生成和推論。在轉向更大的檢查點之前,它提供了另一個可測試的品質檔位。
- 模型建立者
- Qwen / Alibaba Cloud
- 目錄 GPU 記憶體門檻
- 32 GB
Qwen3 Coder 30B
對話 / 推論 · Apache-2.0 · 1 個執行環境設定
為程式撰寫和工具呼叫打造的混合專家檢查點。用結果可驗證的儲存庫任務評估它,例如測試通過或修補正確。
- 模型建立者
- Qwen / Alibaba Cloud
- 目錄 GPU 記憶體門檻
- 32 GB
gpt-oss 20B
對話 / 推論 · Apache-2.0 · 1 個執行環境設定
OpenAI 較小的開放權重推論模型,上游文件說明支援工具呼叫和結構化輸出。可用於私有推論或 AI 代理評估。
- 模型建立者
- OpenAI
- 目錄 GPU 記憶體門檻
- 24 GB
gpt-oss 120B
對話 / 推論 · Apache-2.0 · 1 個執行環境設定
更大的 gpt-oss 推論檢查點。當任務品質值得更大的記憶體預算時評估它,尤其是結果可驗證的工具呼叫工作流程。
- 模型建立者
- OpenAI
- 目錄 GPU 記憶體門檻
- 80 GB
Gemma 3 27B
對話 / 推論 · Gemma Terms of Use · 1 個執行環境設定
Google 的指令微調 Gemma 檢查點,上游支援文字和影像理解。目前的目錄設定為文字對話;影像服務需要另外驗證。
- 模型建立者
- Google DeepMind
- 目錄 GPU 記憶體門檻
- 24 GB
Qwen2.5-VL 7B
對話 / 推論 · Apache-2.0 · 1 個執行環境設定
用於影像和視覺文件問答的視覺語言模型。評估擷取準確度和定位能力時,請使用你實際的影像類型。
- 模型建立者
- Qwen / Alibaba Cloud
- 目錄 GPU 記憶體門檻
- 7 GB
BGE-M3
嵌入 · MIT · 1 個執行環境設定
用於檢索的嵌入模型。它把文件和查詢轉換為可搜尋的表示;建構基於檢索的問答時,與文字模型搭配使用。
- 模型建立者
- BAAI
- 目錄 GPU 記憶體門檻
- 未指定
Whisper large-v3
語音轉文字 · Apache-2.0 · 2 個執行環境設定
用於轉錄和語音翻譯的語音辨識檢查點。它服務的是音訊工作流程,而不是文字對話端點。
- 模型建立者
- OpenAI
- 目錄 GPU 記憶體門檻
- 6 GB;其餘設定未指定
指南只是評估的起點。
這些頁面涵蓋經過審核的上游模型和目錄設定,不承諾即時可用或已測試的部署。請先用指南界定你的工作負載,再與我們確認設定。