NVIDIA H100 ile Neler Yapılabilir? LLM ve Token Rehberi
NVIDIA H100 ile Neler Yapılabilir? LLM, Token ve Yapay Zekâ Sunucu Rehberi
NVIDIA H100 özellikle Generative AI'ın yaygınlaşmasıyla veri merkezlerinde en çok konuşulan GPU modellerinden biri haline geldi.
Ancak H100'ü sadece “çok güçlü ekran kartı” şeklinde değerlendirmek eksik kalır. H100'ün asıl avantajı büyük dil modelleri, yüksek hacimli inference, model eğitimi ve transformer tabanlı uygulamalarda ortaya çıkıyor.
H100 SXM modeli 80 GB HBM3 GPU belleği ve yaklaşık 3,35 TB/s bellek bant genişliği sunuyor.
Bu değerler özellikle büyük miktarda verinin GPU içerisinde hızlı biçimde taşınması gereken AI uygulamalarında önem kazanıyor.
H100 ve Token/s Konusu
LLM sunucularında sık gördüğümüz ölçümlerden biri token/s değeridir.
Token/s, sistemin saniyede kaç token ürettiğini veya işlediğini ifade eder.
Ancak burada çok önemli bir detay var.
Bir H100 için sabit bir:
“H100 saniyede 2.000 token üretir.”
değeri bulunmaz.
Çünkü sonuç birçok değişkene bağlıdır.
Kullanılan model, model büyüklüğü, FP16 veya FP8 kullanılması, quantization, batch size, context uzunluğu, eşzamanlı kullanıcı sayısı ve kullanılan inference motoru performansı ciddi biçimde değiştirir.
Örneğin aynı H100 üzerinde küçük bir model ile 70B sınıfında bir modelin token performansı aynı olmayacaktır.
Bu nedenle GPU karşılaştırırken yalnızca token/s değerine bakmak yerine benchmark'ın hangi şartlarda gerçekleştirildiğini incelemek gerekir.
80 GB H100 Ne Kadar Model Çalıştırabilir?
Kabaca hesaplamak gerekirse model ağırlıklarının bellekte kapladığı alan precision seviyesine göre değişir.
| Model | FP16 yaklaşık | 8-bit | 4-bit |
|---|---|---|---|
| 7B | 14 GB | 7 GB | 3,5 GB |
| 13B | 26 GB | 13 GB | 6,5 GB |
| 30B | 60 GB | 30 GB | 15 GB |
| 70B | 140 GB | 70 GB | 35 GB |
Ancak bunlar yalnızca model ağırlıklarının yaklaşık boyutudur.
Gerçek kullanımda KV Cache, inference engine, CUDA çalışma alanları ve context verileri de GPU belleğini kullanır.
Örneğin 70B modeli 8-bit olarak teorik olarak 70 GB'a indirebilirsiniz. Fakat “H100 80 GB olduğu için kesinlikle rahat çalışır” demek doğru olmaz.
Özellikle uzun context ve çok sayıda eşzamanlı kullanıcı söz konusuysa kalan VRAM hızla kullanılabilir.
H100 Her Proje İçin Gerekli mi?
Hayır.
Küçük bir görüntü tanıma sistemi veya hafif inference projesi için H100 kullanmak gereksiz olabilir.
H100 daha çok GPU'nun ciddi şekilde kullanılacağı;
LLM inference, model eğitimi, yüksek kullanıcı sayısı, Generative AI ve yoğun paralel hesaplama projelerinde anlam kazanır.
Bu nedenle GPU seçimi yapılırken önce iş yükünün analiz edilmesi gerekir.
ServerPark üzerinde farklı GPU seçeneklerine sahip ekran kartlı sunucu modelleri üzerinden projenize uygun sunucu altyapılarını inceleyebilirsiniz.
H100 ile Yapılabilecekler
H100'ün kullanım alanı oldukça geniştir.
| Kullanım | H100 ile yapılabilecek çalışma |
|---|---|
| LLM | Büyük dil modellerini çalıştırma |
| Generative AI | Metin ve içerik üretim modelleri |
| Model Training | Büyük AI modellerini eğitme |
| Fine-tuning | LoRA ve QLoRA |
| RAG | Kurumsal AI asistanları |
| Computer Vision | Görüntü analizi ve nesne tanıma |
| Görsel üretimi | Diffusion modelleri |
| Speech AI | Ses tanıma ve ses modelleri |
| Veri analizi | CUDA hızlandırmalı analiz |
| HPC | Bilimsel hesaplamalar |