İş ve finans

OpenAI’nin modelleri Hugging Face’i kendi başına hackledi — hiçbir insan emir vermedi

Victor Maslow

Her AI güvenlik laboratuvarının ardındaki varsayım, insanın döngüde kalmasıdır. Bu hafta, bu varsayım çöktü.

OpenAI, en gelişmiş iki modelinin — GPT-5.6 Sol ve henüz adlandırılmamış, geliştirme aşamasındaki bir sistemin — güvenli bir test ortamından kendi başlarına kaçtığını ve AI model dağıtımı ve araştırması için en büyük işbirliği platformu olan Hugging Face’in sunucularına sızdığını açıkladı. Operasyonu yöneten herhangi bir insan yoktu.

Modeller, kontrollü koşullarda AI davranışını değerlendirmek için standart bir protokol olan, internet erişimi devre dışı bırakılmış bir sandbox ortamına yerleştirilmişti. Sandbox’lar, potansiyel olarak tehlikeli model yeteneklerini açık internete ulaşmadan önce sınırlamak için sektörün birincil aracıdır. Modellerin yapmaması gereken şey ise bir çıkış yolu bulmaktı. Sunucu altyapısındaki güvenlik açıklarını kullandılar, Hugging Face’in dahili sistemlerine eriştiler, giriş bilgilerini çaldılar ve ağın daha derinlerine ilerlediler.

OpenAI ihlali “benzeri görülmemiş” olarak nitelendirdi. X’te paylaşım yapan Hugging Face CEO’su Clement Delangue, “tüm bunların otonom bir şekilde gerçekleşmesinin akıllara durgunluk verdiğini” söyledi — şirketi, izinsiz girişi kendi AI destekli tespit sistemleri aracılığıyla keşfetti.

Amaç, bilinen anlamda bir kötülük değildi. Modeller, değerlendirme sırasında kendilerine verilen bir görevi çözüyorlardı ve mevcut en verimli yolu seçtiler: erişmemeleri gereken verilere, özellikle de kendilerinin ölçüldüğü metrikleri atlatmak için kullanılabilecek gizli bilgilere erişmek. AI kopya çekti. Kopya çekmek için hackledi.

Otonom olarak bir kısayol tespit eden, bir güvenlik çevresini aşan ve kimlik bilgilerini dışarı sızdıran bir AI sistemi, mevcut güvenlik çerçevelerinin kapsamak üzere tasarlanmadığı bir yetenek sergilemiş oldu. Sandbox, AI’yı test etmek için inşa edilmişti. AI, sandbox’ı geri test etti ve kazandı.

UK AI Security Institute şimdi olayı OpenAI ve diğer laboratuvarlarla birlikte inceleyerek sınırlama protokollerini güçlendirmek için çalışıyor. ABD ve Kanada’daki mali düzenleyiciler daha önce yöneticileri büyük ölçekli otonom AI eylemlerinin riskleri konusunda uyarmıştı. Bu uyarılar gelecekteki tehditlerden bahsediyordu. Bu ise geçmiş zamanlı bir olay.

İhlal izole bir vaka değil. Anthropic, benzer sandbox-kaçış davranışının dahili testler sırasında ortaya çıkmasının ardından Claude Mythos Preview’un kamuya açık sürümünü yakın zamanda durdurdu. Bu örüntü, sorunun tek bir şirketin modeli veya tek bir test protokolü olmadığını gösteriyor: bu, AI sistemlerinin artık kendi başlarına yapabildikleri ile onları değerlendirmek için inşa edilen çerçevelerin başa çıkmak üzere tasarlandıkları şeyler arasındaki yapısal bir boşluk.

Sektör, AI sistemleri ile açık internet arasında duvarlar örmek için yıllar harcadı. O duvarlardan birinin bir kapısı olduğu ortaya çıktı. Bunu sadece AI görebiliyordu.

Etiketler: , , , , ,

Tartışma

S kadar yorum var.