Teknoloji

OpenAI AGI çağını ilan etti. Atıfta bulunduğu benchmark 37 puan daha düşük

Adrian Kessler

Jensen Huang‘ın X’teki paylaşımı tek bir cümle ve bir tebrikten ibaretti: “ChatGPT’ten o1’e ve Astra’ya 4 yılda AGI geldi. Tebrikler @OpenAI ekibi.” Bunu 6 Eylül’de gönderdi. Üç gün önce, OpenAI’in başkanı Greg Brockman basına neredeyse aynı ifadeyi kullanmıştı: “AGI çağına hoş geldiniz.” Açıklamalar, tamamlayıcı çıkarları olan iki adamdan birbirine yakın zamanlarda geldi ve büyük ölçüde bir teyit olarak karşılandı.

İddianın altında yatan kıyaslama ARC-AGI-3’tü. OpenAI, GPT-6 adıyla piyasaya sürülen yeni sınır modeli Astra’nın ARC-AGI-3’te %99,9, FrontierMath Tier 4’te ise %98 puan aldığını söyledi. Standart koşullar altında bu seviyedeki puanlar gerçek bir süreksizlik anlamına gelirdi — yalnızca iyi performans göstermekle kalmayıp, daha önceki kıyaslamaların ulaşılması güç hedef olarak gördüğü bir bölgeye giren bir model. ARC-AGI-3’ü oluşturan kuruluş, kendi standart değerlendirme donanımlarından bir puan yayımladı: %62,7.

Bu iki rakamı 37 puanlık bir fark ayırıyor. Her ikisi de gerçek değerlendirmelerden geliyor. OpenAI’in dahili donanımı ile kıyaslama oluşturucularının referans donanımı aynı protokol değil ve aynı model her birinde farklı puanlar üretiyor. ARC-AGI-3 kuruluşunun referans koşulu olarak kullandığı — alandaki modelleri karşılaştırmak için geçerli saydığı — koşul %62,7 verdi. OpenAI’in dahili kurulumu %99,9 verdi. Bu iki rakam arasındaki fark, güçlü bir kıyaslama sonucu ile bir varış ilanı arasındaki farktır.

AGI tebriğinin ardındaki çip satışı

Astra, NVIDIA çipleriyle eğitildi. Huang, NVIDIA çipleri satıyor. Bir CEO, bir müşterisini tarihsel bir eşiği geçtiği için alenen tebrik ettiğinde — ki bu eşik, o ürünü inşa etmek için kullanılan donanımı, bundan sonra gelecek olanın tanımlayıcı altyapısı haline getiriyor — bu duyuru, yapısal olarak ticari bir iddiadır. Bir komplo değil. Yapısal bir gerçeklik: çıkar çatışması görünürdü, çerçeve performanstan ziyade varış üzerine kuruluydu ve haberlerin çoğu bunu yorum yapmadan karşıladı.

Yapay zeka altyapısı için çip pazarı anlatı üzerinde hareket eder. Eğer Astra AGI ise, o zaman Astra’yı eğiten neyse, AGI sonrası dünyanın donanımı haline gelir — ve bir sonraki eğitim için çip satın alan şirketler, o kıyaslamaya yönelik alım yapacaktır. Huang’ın tebrikleri, bu özel anlamda, aynı zamanda bir ürün beyanıydı. Beyan, kıyaslama kuruluşunun kendisinin farklı ölçtüğü bir sayıya dayanıyordu.

Bağımsız doğrulamanın gösterdikleri — ve göstermedikleri

Yayın anı itibarıyla Astra, sınır modeller için en çok izlenen iki bağımsız değerlendirme sistemi olan Artificial Analysis Intelligence Index ve Arena.ai sıralamalarında görünmüyor. Büyük sınır sürümleri için bağımsız doğrulama genellikle günler içinde gelir. Buradaki yokluk, kötü performansın kanıtı değil. Bu büyüklükteki bir iddiaya normalde eşlik edecek olan dış doğrulamanın henüz gerçekleşmediği anlamına geliyor.

Kıyaslama oluşturucularından gelen %62,7 bir çürütme değil. ARC-AGI-3’te bu seviyedeki bir puan — önceki kıyaslamaları şişiren optimizasyon hilelerine direnmek için tasarlanmış bir test — gerçekten güçlüdür. ARC-AGI-3’ün öncülleri doymuştu: modeller, test sorularına benzeyen eğitim verilerini emdi ve yeni akıl yürütmede iyileşme olmadan sayıları yukarı çekti. ARC-AGI-3, desen erişimi yerine soyutlama gerektirecek şekilde soru tasarımını değiştirdi. Bu testte, referans donanım altında %62,7, iki yıl önce var olan her şeyin çok üzerindedir.

İtirazlarını dile getiren araştırmacılar bu konuda nettiler. Modelin yeteneği onların hedefi değildi. Performanstan beyana sıçramaydı hedef. “Bu kıyaslamalarda iyi puan almak” ile “AGI geldi” arasında bir adım gerekir: varışın ölçülebileceği istikrarlı, üzerinde anlaşılmış bir AGI tanımı. Alan genelinde böyle bir tanım yok. OpenAI’in kendine ait bir tanımı var. OpenAI’in kendi tanımına göre Astra uygun olabilir. Ancak bir şirketin ürününü kendi yazdığı bir tanıma göre ölçmesi, dış bir standartla ölçülenden farklı türde bir sonuçtur.

Tanımla birlikte gelmeyen cümle

Huang’ın paylaşımında hiçbir uyarı yoktu. “AGI geldi” bildirimsel bir ifadedir — “bazı ölçütlere göre” veya “belirli tanımlar altında” değil, net bir varış. Adını koyduğu dört yıllık ilerleme — ChatGPT, o1, Astra — bir yetenek yörüngesi olarak gerçektir. Dizideki her model mümkün olanı genişletti. Bu diziyi bir bitiş noktası olan bir yolculuk olarak çerçevelemek ve bitiş noktasını duyurmak farklı bir iddiada bulunur: varışın yolculuktan ayırt edilebilir olduğunu, bir eğim değil bir çizgi olduğunu ve Astra’nın bu çizgiyi geçtiğini söyler.

Bu iddianın arkasındaki kıyaslama puanı %62,7 idi. Testi inşa edenler bunu yayımladı. Ortaya çıkardığı soru — AGI ilanının bir ölçüm mü yoksa bir pazar hamlesi mi olduğu — 6 Eylül’de oradaydı. Haberler bu soruyu büyük ölçüde sormadan yanıtladı.

Etiketler: , , , , ,

Tartışma

S kadar yorum var.