워크로드부터 시작하세요. 그다음 머신을 고르세요.
하드웨어를 정하기 전에 모델 프로필과 메모리 요구 사항을 비교하세요. 각 가이드는 카탈로그에 적힌 내용과 아직 테스트가 필요한 부분을 구분합니다.
모델 가이드 12개 · 출처 검토일 2026-09-30
메모리 필터는 런타임 프로필 하나 이상에 기록된 카탈로그 기준값과 비교합니다. 미지정 기준은 0으로 세지 않습니다. 카드 한 장에 들어가는지나 실측 메모리 사용량을 검증하는 것은 아닙니다. 출처는 검토되었으며, 이 그룹에 대해 공개된 B3IQ 벤치마크는 없습니다.
Llama 3.1 8B
채팅 / 추론 · Llama 3.1 Community License · 런타임 프로필 1개
채팅, 요약, 검색 기반 답변을 위한 텍스트 어시스턴트 체크포인트입니다. 자신의 프롬프트로 작은 Llama 배포를 평가하고 싶다면 여기서 시작하세요.
- 모델 제작사
- Meta
- 카탈로그 GPU 메모리 기준
- 8 GB
Llama 3.3 70B
채팅 / 추론 · Llama 3.3 Community License · 런타임 프로필 1개
다국어 대화를 위한 Meta의 지시 조정 텍스트 모델입니다. 작은 어시스턴트가 품질 기준에 못 미치고 GPU 메모리를 더 쓸 수 있다면 평가해 보세요.
- 모델 제작사
- Meta
- 카탈로그 GPU 메모리 기준
- 80 GB
Qwen3 8B
채팅 / 추론 · Apache-2.0 · 런타임 프로필 2개
업스트림에서 사고 모드와 비사고 모드를 지원하는 소형 Qwen 텍스트 모델입니다. 가중치 용량이 크지 않아 추론 동작을 비교하는 출발점으로 쓰기 좋습니다.
- 모델 제작사
- Qwen / Alibaba Cloud
- 카탈로그 GPU 메모리 기준
- 미지정
Qwen3 14B
채팅 / 추론 · Apache-2.0 · 런타임 프로필 3개
작은 밀집 체크포인트와 큰 밀집 체크포인트 사이에 있는 Qwen 텍스트 모델입니다. 더 큰 머신을 정하기 전에 자신의 어시스턴트나 코딩 프롬프트로 비교하세요.
- 모델 제작사
- Qwen / Alibaba Cloud
- 카탈로그 GPU 메모리 기준
- 기록된 프로필 기준 16–24 GB; 다른 프로필은 미지정
Qwen3 32B
채팅 / 추론 · Apache-2.0 · 런타임 프로필 1개
텍스트 생성과 추론을 위한 더 큰 밀집 Qwen 모델입니다. 훨씬 큰 체크포인트로 넘어가기 전에 테스트할 수 있는 또 하나의 품질 기준점을 제공합니다.
- 모델 제작사
- Qwen / Alibaba Cloud
- 카탈로그 GPU 메모리 기준
- 32 GB
Qwen3 Coder 30B
채팅 / 추론 · Apache-2.0 · 런타임 프로필 1개
코딩과 도구 사용을 위해 만들어진 전문가 혼합(MoE) 체크포인트입니다. 테스트 통과나 올바른 패치처럼 결과를 확인할 수 있는 저장소 작업으로 평가하세요.
- 모델 제작사
- Qwen / Alibaba Cloud
- 카탈로그 GPU 메모리 기준
- 32 GB
gpt-oss 20B
채팅 / 추론 · Apache-2.0 · 런타임 프로필 1개
OpenAI의 작은 오픈 웨이트 추론 모델로, 도구 사용과 구조화된 출력 지원이 업스트림에 문서화되어 있습니다. 프라이빗 추론이나 에이전트 평가에 고려해 보세요.
- 모델 제작사
- OpenAI
- 카탈로그 GPU 메모리 기준
- 24 GB
gpt-oss 120B
채팅 / 추론 · Apache-2.0 · 런타임 프로필 1개
더 큰 gpt-oss 추론 체크포인트입니다. 작업 품질이 더 큰 메모리 예산을 정당화할 때, 특히 결과를 검증할 수 있는 도구 사용 워크플로에서 평가하세요.
- 모델 제작사
- OpenAI
- 카탈로그 GPU 메모리 기준
- 80 GB
Gemma 3 27B
채팅 / 추론 · Gemma Terms of Use · 런타임 프로필 1개
Google의 지시 조정 Gemma 체크포인트로, 업스트림에서는 텍스트와 이미지 이해를 지원합니다. 현재 카탈로그 프로필은 텍스트 채팅이며, 이미지 서빙은 별도 검증이 필요합니다.
- 모델 제작사
- Google DeepMind
- 카탈로그 GPU 메모리 기준
- 24 GB
Qwen2.5-VL 7B
채팅 / 추론 · Apache-2.0 · 런타임 프로필 1개
이미지와 시각 문서에 대한 질문을 위한 비전-언어 모델입니다. 추출 정확도와 그라운딩을 평가할 때는 실제로 쓰는 이미지 유형을 사용하세요.
- 모델 제작사
- Qwen / Alibaba Cloud
- 카탈로그 GPU 메모리 기준
- 7 GB
BGE-M3
임베딩 · MIT · 런타임 프로필 1개
검색을 위한 임베딩 모델입니다. 문서와 질의를 검색 가능한 표현으로 바꾸며, 검색 기반 답변을 만들 때는 텍스트 모델과 함께 사용하세요.
- 모델 제작사
- BAAI
- 카탈로그 GPU 메모리 기준
- 미지정
Whisper large-v3
음성을 텍스트로 · Apache-2.0 · 런타임 프로필 2개
전사와 음성 번역을 위한 음성 인식 체크포인트입니다. 텍스트 채팅 엔드포인트가 아니라 오디오 워크플로를 담당합니다.
- 모델 제작사
- OpenAI
- 카탈로그 GPU 메모리 기준
- 6 GB; 다른 프로필은 미지정
가이드는 평가의 출발점입니다.
이 페이지들은 검토된 업스트림 모델과 카탈로그 프로필을 다룹니다. 실시간 가용성이나 테스트된 배포를 약속하지 않습니다. 가이드로 워크로드 범위를 정한 뒤, 구성은 저희와 함께 확인하세요.