Teknoloji

DeepSeek V4.1 Flash: 552 milyar parametre, 8 milyar aktif, önbellek %60 ucuz — ve Opus 5 ile eşit

Adrian Kessler

DeepSeek V4.1 Flash, şirketin Causal Encoder-Decoder adını verdiği yeni bir mimari üzerinde çalışıyor. 552 milyar parametresi 20 katmanlı bir kodlayıcı ve 20 katmanlı bir kod çözücüye yayılıyor, ancak giriş token’larında yalnızca 8 milyar, çıkışta ise 16 milyar parametre aktif hale geliyor. Bu, her işlem için daha büyük parametre dilimlerini etkinleştiren modellere kıyasla yapısal olarak daha yalın olmasını sağlıyor — çıkarım maliyeti ve bellek verimliliğinde doğrudan karşılığını veren bir tasarım tercihi.

Bellek kazanımları spesifik. V4.1 Flash’ın KV önbelleği, token başına 890 baytta kalıyor — bu, V4-Flash’ın yaklaşık dörtte biri. FP4 önbellekleme ve Compressed Sparse Attention 2 sayesinde kalıcı önbellek boyutu önceki neslin sekizde birine düşüyor. Önbelleğe alınmış girişin maliyeti, yoğun olmayan saatlerde milyon token başına 0,003 dolara geriledi — V4-Flash’a kıyasla %60 daha düşük. Önbelleğe alınmamış giriş %33, çıkış ise %11 düştü.

Geliştiricilerin en çok takip ettiği kıyaslamalarda model kendini kanıtlıyor. Otonom yazılım mühendisliği testi DeepSWE v1.1’de 74,2 puan alarak Anthropic‘in Opus 5’inin 74,0 ve GPT-5.6 Sol’un 73,0 puanının kıl payı önünde yer alıyor. GPQA Diamond skoru ise 90,9. Göze çarpan fark Terminal-Bench 3.0’da ortaya çıkıyor: 30,0’a karşı Opus 5’in 43,3’ü — genişletilmiş etkileşimli hata ayıklama gerektiren görevlerde gerçek bir fark.

Görüntü işleme, ön eğitimden itibaren modele entegre edilmiş durumda. Daha önce V4, görüntü işlemeyi ayrı bir Vision-Exp varyantına ayırmıştı. V4.1 Flash, her ikisini de en başından itibaren dil modeliyle birlikte geliştirilen, amaca özel eğitilmiş bir kodlayıcı olan DeepSeek-ViT etrafında inşa edilmiş tek bir modelle değiştiriyor. Çok modlu katman ortadan kalktı — artık her çağrı varsayılan olarak görüntü işleme yeteneğine sahip.

Bağlam pencerisi 1 milyon token olup çıktı 384.000 token ile sınırlandırılmış; bu, parçalama ihtiyacı olmadan uzun formlu belge analizi ve genişletilmiş ajan iş akışları için yeterli. Eski deepseek-v4-flash ve deepseek-v4-flash-vision-exp ID’lerini kullanan mevcut API çağrıları zaten V4.1 Flash’a yönlendiriliyor. 14 Eylül’de DeepSeek V4 Pro trafiği de Flash fiyatlandırmasıyla bu modele geçecek.

DeepSeek, V4.1 Flash’ı “yeni mimari ailemizdeki en küçük model” olarak tanımladı. Aynı Causal Encoder-Decoder tasarımına sahip daha büyük bir V4.1 Pro’nun yolda olduğu ima ediliyor. Eğer Flash’ın verimlilik yörüngesini korursa, bu mimarinin performans-başına-maliyet oranını, şu anda milyon token başına önemli ölçüde daha yüksek maliyetli modellerin tuttuğu kıyaslama eğrisinde daha da yukarılara taşıyacaktır.

Mimari nokta, fiyatlandırma tablosunun ötesinde de önem taşıyor. KV önbellek büyümesi, büyük modelleri uzun bağlamda çalıştırmanın önündeki birincil kısıttır ve işlenen her token ile ölçeklenir. V4.1 Flash’ın yaklaşımı — daha az aktif parametre, sıkıştırılmış önbellek — bu kısıtlamayı doğrudan ele alıyor. Bu, uç bir durum optimizasyonu değil, uzun bağlamlı dağıtımlar için kullanılabilir bir şablon.

Etiketler: , , , , ,

Tartışma

S kadar yorum var.