measured / 2026-08-13

Güncel donanımın düğüm başına hizmet kapasitesi

Tek düğümlerdeki açık ağırlıklı modeller için yayımlanmış MLPerf Inference v6.0 sonuçları.

Yöntem

Donanım
Llama 3.1 8B için 8x NVIDIA B200; GPT-OSS 120B için 4x NVIDIA GB300
İş yükü
Sabit doğruluk ve gecikme koşullarıyla MLPerf Offline, Server ve Interactive senaryoları
Tekrar
Denetlenen MLPerf gönderim kurallarının gerektirdiği şekilde
Araç
vLLM kullanan, gönderen tarafından ayarlanmış MLPerf Inference düzeneği

Sonuçlar

Llama 3.1 8B - offline160.403 token/s8x B200, kapalı bölüm
Llama 3.1 8B - server130.008 token/sGecikme sınırlı
Llama 3.1 8B - interactive128.750 token/sDaha sıkı gecikme koşulu
GPT-OSS 120B - server53.463 token/s4x GB300

Çıkarım

Kapasite artık genel sağlayıcıların erişilmez donanıma sahip olduğu iddiası değil, eşzamanlılık ve bağlam uzunluğu boyutlandırma problemidir.