measured / 2026-08-13
Güncel donanımın düğüm başına hizmet kapasitesi
Tek düğümlerdeki açık ağırlıklı modeller için yayımlanmış MLPerf Inference v6.0 sonuçları.
Yöntem
- Donanım
- Llama 3.1 8B için 8x NVIDIA B200; GPT-OSS 120B için 4x NVIDIA GB300
- İş yükü
- Sabit doğruluk ve gecikme koşullarıyla MLPerf Offline, Server ve Interactive senaryoları
- Tekrar
- Denetlenen MLPerf gönderim kurallarının gerektirdiği şekilde
- Araç
- vLLM kullanan, gönderen tarafından ayarlanmış MLPerf Inference düzeneği
Sonuçlar
Llama 3.1 8B - offline160.403 token/s8x B200, kapalı bölüm
Llama 3.1 8B - server130.008 token/sGecikme sınırlı
Llama 3.1 8B - interactive128.750 token/sDaha sıkı gecikme koşulu
GPT-OSS 120B - server53.463 token/s4x GB300
Çıkarım
Kapasite artık genel sağlayıcıların erişilmez donanıma sahip olduğu iddiası değil, eşzamanlılık ve bağlam uzunluğu boyutlandırma problemidir.