Teknoloji

Anthropic CEO’su yavaşlama istedi, Claude Opus 5.5 yüzde 40 ucuzlayarak geldi

Susan Hill
Bizi Google'a ekleyin

Claude Opus 5.5, Anthropic’in önceki modellerinde olmayan bir şey yapıyor: daha düşük maliyetle ve daha hızlı çalışırken, daha büyük ve pahalı bir sistemi eşleştiriyor veya geçiyor. Model; ajan kodlama, bilgisayar kullanımı, grafik okuma ve disiplinlerarası akıl yürütme alanlarında, Anthropic’in kendi verilerine göre, şirketin daha önceki en yetenekli modeli Claude Fable 5.1’i bazı ölçütlerde geride bırakıyor. Opus 5’i kullanışlı ama pahalı bulan kişi ve geliştiriciler için modelin yapabildikleri ile maliyeti arasındaki fark önemli ölçüde değişti.

Fiyat farkı net. Opus 5.5, milyon giriş token başına 4 dolar, milyon çıkış token başına 20 dolar ücretlendiriyor; Opus 5 ise sırasıyla 5 ve 25 dolardı. Önbelleğe alınmış okumalar milyon token başına 0,50 dolardan 0,20 dolara düştü. Anthropic, tipik iş yüklerinin genel olarak yaklaşık %40 daha ucuza çalıştığını söylüyor. Hız da aynı yönde: standart model, metni Opus 5’ten %30’dan fazla daha hızlı üretiyor. Ayrı bir hızlı mod seçeneği, milyon token başına 8 dolar giriş ve 40 dolar çıkış fiyatıyla, standart Opus 5’in hızının 2,5 katına kadar çıkıyor—gecikmeye duyarlı uygulamalar için kullanışlı bir ayar.

Anthropic’in yayınladığı performans rakamları, Opus 5.5’i altı kriterin dördünde Fable 5.1, Opus 5 ve GPT-6 Astra’nın önüne koyuyor. Canlı bir terminal ortamında kod yürütmeyi test eden Terminal-Bench 4.0’da Opus 5.5, %66,4 puan alırken Fable 5.1 %55,8. Akademik ve profesyonel bilgiyi disiplinler arası test eden Humanity’s Last Exam’de sonuç %67,7’ye karşı %65,6. Bilgisayar arayüzü işlemlerini ölçen OSWorld 2.0’da %81,8’e karşı %80,7. Deloitte testi, Opus 5.5’in en düşük çaba ayarında, incelemede bilinen kodlama hatalarının %72’sini tespit ettiğini, Opus 5’in yüksek çaba ayarında ise %56 olduğunu gösterdi. Bu rakamlar Anthropic ve seçilmiş ortaklarından geliyor; belirtilen hata payları ±1,6 ila ±5 yüzde puanı arasında değişiyor ve lansman sırasında bağımsız bir üçüncü taraf doğrulaması yayınlanmadı.

İki alan bu örüntünün dışında. AutomationBench’te GPT-6 Astra %41,4 puan alırken Opus 5.5 %40,0. Terminal-Bench-Science’ta fark daha büyük: Astra %64,6’ya ulaşırken Opus 5.5 %58,7’de kalıyor. Her iki fark da belirtilen hata payları içinde—gürültü olabilir—ama olmayabilir de. Anthropic bu satırları kendi yayınladığı tabloya dahil ediyor ki bu, çoğu yapay zeka şirketinin lansmanda yaptığından daha fazlası. Rakamların kesin olarak kabul edilmesi için hâlâ bağımsız incelemeye ihtiyaç var.

Güvenlik konusunda Anthropic, Opus 5.5’in piyasaya sürülmeden önce METR dahil harici ekipler tarafından değerlendirildiğini söylüyor. Şirketin kendi iç davranış denetiminde, modelin kendisine konulan kısıtlamaları aşmaya çalışıp çalışmadığını test eden yaklaşık 2.000 senaryoda, Opus 5.5’in Opus 5’e kıyasla bu tür bir aşma girişiminde bulunma olasılığının %85 daha az olduğu belirtiliyor. Daha güçlü modeller genellikle geçici çözümler bulma konusunda daha yetenekli olma eğilimindedir; bu da iyileştirmeyi, eğer geçerliyse, anlamlı kılıyor. Gerçek test, dağıtım deneyimi olacak.

Bu lansmanı sıra dışı kılan zamanlaması. Bu ayın başlarında Anthropic CEO’su Dario Amodei, yapay zeka risklerinin tam olarak ele alınmasının “risk önlemenin yetişmesi için yeteneklerin ilerleme hızını yavaşlatmayı” gerektirdiğine ikna olduğunu yazdığı bir makale yayınladı. OpenAI’den Sam Altman ve Elon Musk genel endişeye katıldıklarını ifade etti. Nvidia’dan Jensen Huang, altta yatan bilimin bunu desteklemediğini söyledi. Ve ardından Anthropic, selefinden daha hızlı, daha ucuz ve daha yetenekli bir model piyasaya sürdü. Bir yorum: Daha iyi güvenlik değerlendirmeleri ve daha geniş erişime sahip bir model, Amodei’nin aklındakinin tam olarak bu olduğu. Bir diğeri: Makale, yeteneklerin ilerlemesini endişe kaynağı olarak adlandırdı ve yetenekler ilerledi. Her iki yorum da aynı olgular kümesinde yer alıyor ve Anthropic’in kriterleri tek başına hangisinin doğru olduğunu çözemez.

Claude Opus 5.5, 22 Eylül 2026 itibarıyla API model kimliği claude-opus-5-5 ile kullanıma sunuldu. Claude’da Pro, Max, Team ve Enterprise planlarında çalışıyor ve AWS, Google Cloud ile Microsoft Azure üzerinden erişilebilir. Anthropic, beş saatlik abonelik katmanlarındaki kullanım sınırlarını artırıyor. 5.5 ailesinin kalan üyeleri Sonnet 5.5 ve Haiku 5.5’in önümüzdeki haftalarda piyasaya sürülmesi planlanıyor; her ikisi için de fiyatlandırma veya belirli bir çıkış tarihi açıklanmadı.

Etiketler: , , , , ,

Bizi Google'a ekleyin

Tartışma

S kadar yorum var.