sunucu.com.tr
Yapay Zeka

vLLM 0.31.0 yayında: vllm preload ile hızlı yeniden başlatma ve GPU sunucuda model servisine etkisi

vLLM 0.31.0 ile gelen vllm preload, model ağırlıklarını motor yeniden başlasa da GPU belleğinde tutuyor. 0.30 ve 0.31'deki kırıcı değişiklikleri, KV önbellek taşırmayı ve kendi GPU sunucunuzda güvenli yükseltme adımlarını özetledik.

sunucu.com.tr Ekibi4 dk okuma

vLLM ekibi iki hafta arayla iki sürüm çıkardı: 0.30.0 ve 5 Ekim 2026'da yayımlanan 0.31.0. Kendi GPU sunucusunda açık ağırlıklı model servis eden ekipleri en çok ilgilendiren yenilik, yeniden başlatma süresini kısaltmayı hedefleyen vllm preload komutu. İki sürümde de yapılandırmanızı etkileyebilecek kırıcı değişiklikler var, o yüzden yükseltmeden önce bunlara bakmanız gerekiyor.

Ne değişti

0.31.0: vllm preload ve ağırlık önbelleği

Yeni vllm preload komutu ayrı bir ağırlık önbelleği servisi başlatıyor. Bu servis nicemlenmiş model ağırlıklarını GPU belleğinde tutuyor ve inference motoru yeniden başlasa bile ağırlıklar orada kalıyor. Veri paralelliğini destekliyor, ayrıca izleme araçlarının yoklayabileceği bir sağlık kontrol uç noktası sunuyor.

Bu sürümdeki diğer başlıklar:

  • DeepSeek-V4.1-Flash için performans iyileştirmeleri geldi. SM100 GPU'larda varsayılan dikkat yöntemi artık FlashMLA mega attention.
  • Model Runner V2 artık taslak modelle spekülatif çözümlemeyi ve özel logits işlemcilerini destekliyor.
  • Profilleme aşaması MoE belleğini de hesaba katıyor. Amaç, büyük kurulumlarda bellek yetersizliği hatalarını önlemek.

0.30.0: yeni modeller ve KV önbellek taşırma

  • DeepSeek-V4.1-Flash, GLM-5.3-Flash, K2-Horizon ve Cohere Compass desteği eklendi.
  • HiSparse özelliği, GPU belleği yetmediğinde KV önbellek sayfalarını ana makinenin sabitlenmiş (pinned) belleğine taşıyor.

Kırıcı değişiklikler

Yükseltmeden önce şu listeyi kendi yapılandırmanızla karşılaştırın:

  • 0.31.0: İstek başına gönderilen çok kipli parametreler artık --trust-request-mm-kwargs bayrağı verilmeden kabul edilmiyor.
  • 0.31.0: tokenizer_mode="slow" seçeneği kaldırıldı.
  • 0.31.0: Intel XPU grafikleri varsayılan olarak açık geliyor.
  • 0.30.0: Ölçeklenen uç noktalar varsayılan olarak kapalı. Kullanıyorsanız --enable-scale-out ile açmanız gerekiyor.
  • 0.30.0: GPTQ etkinleştirme sıralaması kaldırıldı.

Ne anlama geliyor

Büyük bir modeli servis edenler, yeniden başlatmanın en uzun kısmının ağırlıkları diskten okuyup GPU'ya yüklemek olduğunu bilir. Yapılandırmayı değiştirdiğinizde, bir hata sonrası süreç çöktüğünde ya da yeni bir bayrağı denerken bu bekleme tekrar tekrar yaşanır. vllm preload ağırlıkları motordan ayrı bir serviste tuttuğu için motorun yeniden başlaması ağırlıkları baştan yüklemeyi gerektirmiyor. Ne kadar hızlandığı model boyutuna ve kurulumunuza bağlı. Kendi ortamınızda ölçmeden bir rakam beklemeyin.

Türkiye'deki ekipler için pratik etkiler şöyle:

  • Daha kısa kesinti: Müşteri destek botu ya da iç arama asistanı gibi tek GPU sunucuda çalışan servislerde bakım penceresi kısalır. Yedek sunucu tutamayan KOBİ'ler için bu önemli.
  • Bellek planı değişir: Ağırlıklar GPU'da kalıcı durduğu için motor ve önbellek servisinin belleği nasıl paylaştığını planlamanız gerekir. HiSparse ise GPU belleği daraldığında KV önbelleğini ana belleğe taşıyarak uzun bağlamlı Türkçe dokümanlarla çalışırken nefes aldırabilir. Bunun karşılığında sunucunuzda yeterli sistem belleği olması gerekir ve taşıma bir miktar gecikme ekleyebilir.
  • Veri yurt içinde kalır: Modeli kendi sunucunuzda çalıştırınca istemler ve yanıtlar üçüncü taraf bir API'ye gitmez. Bu, KVKK kapsamındaki müşteri verisiyle çalışan ekipler için en güçlü gerekçe olmaya devam ediyor.
  • Güvenlik varsayılanı sıkılaştı: Çok kipli parametrelerin artık açık bir bayrak istemesi, servisi dışarıya açan ekiplerin istemciden gelen girdiye daha az güvenmesi anlamına geliyor. Bayrağı açmadan önce API'nizin kimlerden istek aldığını netleştirin. Uç noktayı kimlik doğrulamasız internete açmamak için Nginx ters vekil ve kimlik doğrulama yazımızdaki yaklaşım vLLM için de geçerli.

Nasıl denenir

Üretimdeki kurulumu doğrudan yükseltmeyin. Ayrı bir sanal ortamda ya da ayrı bir sunucuda deneyin. PyPI'deki paket Python 3.10 ve üzerini istiyor, 3.15 ve sonrası desteklenmiyor.

bash
python3 -m venv ~/vllm-031
source ~/vllm-031/bin/activate
pip install "vllm==0.31.0"
pip show vllm
vllm preload --help

Önerdiğimiz sıra:

  1. Bayrakları tarayın. Başlatma betiklerinizde, systemd birimlerinizde ve compose dosyalarınızda tokenizer_mode="slow", ölçeklenen uç nokta kullanımı ve GPTQ ayarlarını arayın. Çok kipli istek gönderen istemcileriniz varsa --trust-request-mm-kwargs gerekip gerekmediğine karar verin.
  2. Önce aynı modelle karşılaştırın. Yeni sürümü, şu an çalıştırdığınız modelle aynı istem setiyle deneyin. Türkçe yanıt kalitesinde ve token üretim hızında bir fark var mı bakın.
  3. preload'u ayrı test edin. Önbellek servisini başlatın, sağlık uç noktasını izleme sisteminize ekleyin, sonra motoru birkaç kez yeniden başlatıp süreyi önceki sürümle karşılaştırın.
  4. Bellek sınırını zorlayın. Uzun bağlam ve eşzamanlı istekle yük testi yapın. KV önbelleğin ana belleğe taşındığı durumda gecikmenin nasıl değiştiğini ölçün.

GPU bellek ihtiyacını genel ilkelerle hesaplayın: ağırlıkların kapladığı alan parametre sayısı ve nicemleme düzeyiyle orantılıdır. Bunun üstüne KV önbellek gelir ve bağlam uzunluğu ile eşzamanlı istek sayısıyla büyür. MoE modellerde tüm uzmanların ağırlıkları bellekte durur, bu yüzden aktif parametre sayısına bakıp karar vermeyin. Nicemlenmiş bir model, aynı modelin tam hassasiyetli sürümünden belirgin biçimde daha az yer kaplar, ama kaliteyi kendi görevinizde doğrulamanız gerekir.

Deneme ortamı için bellek miktarını seçebileceğiniz bir GPU sunucu kullanabilirsiniz. Mevcut model servis kurulumunuzu başka bir sağlayıcıdan getirmek ya da sürüm yükseltmesini planlı yapmak isterseniz taşıma desteğimizden yararlanabilirsiniz.

Sık sorulan sorular

vllm preload kullanmak zorunlu mu?

Hayır. Bu isteğe bağlı bir servis. Sık yeniden başlatma yapmıyorsanız mevcut başlatma yönteminizle devam edebilirsiniz. Yararı, yapılandırmayı sık değiştiren ya da kesinti süresini kısaltmak isteyen ekiplerde ortaya çıkar.

0.29'dan doğrudan 0.31'e geçebilir miyim?

Geçebilirsiniz, ama arada 0.30.0'ın kırıcı değişiklikleri de var. Ölçeklenen uç noktalar ve GPTQ ayarları için iki sürümün notlarını birlikte okuyun.

HiSparse GPU belleği eksikliğini tamamen çözer mi?

Hayır. HiSparse yalnız KV önbellek sayfalarını ana belleğe taşıyor, model ağırlıkları yine GPU'ya sığmalı. Bu nedenle bir esneklik payı olarak görün, kapasite planınızın yerine koymayın.

Kendi sunucumda çalıştırmak API kullanmaktan ucuz mu?

Bu kullanım yoğunluğunuza bağlı. Sürekli ve yüksek hacimli kullanımda sabit maliyetli bir sunucu avantajlı olabilir. Ara sıra kullanımda API daha mantıklı olabilir. Veri gizliliği gereksinimi de hesaba katılmalı.

Kaynaklar

  • #vllm
  • #gpu sunucu
  • #açık ağırlıklı model
  • #model servisi
  • #llm inference
  • #yapay zeka gündemi

İlgili yazılar

Yapay Zeka yazıları