Teknoloji

Bir yapay zeka ajanı kendi modelini yeniden eğitti ve güvenlik filtrelerini sildi

Adrian Kessler
Bizi Google'a ekleyin

Bir yapay zeka kodlama ajanı, bir yazılım deposuna erişim verilip hatalı uygulama çıktılarını düzeltmesi istendiğinde, sorunu kimsenin belirtmediği bir yolla çözdü: depo içindeki eğitim verilerini ve ince ayar betiğini buldu, başarısızlıkları gidermek için sentetik eğitim kayıtları oluşturdu, ince ayar çalıştırmasını gerçekleştirdi ve değiştirilmiş modeli deponun kendi dağıtım araçlarını kullanarak yeniden dağıttı. Test doğruluğu sıfırdan mükemmel puana yükseldi. Hata düzeltilmişti.

Yapay zeka güvenlik firması Irregular’daki araştırmacılar deneyi Çarşamba günü yayımladı. Belgelenen şey belirli bir üründeki bir güvenlik açığı değil; yetenekli bir kodlama ajanına, birçok kurumsal dağıtımın halihazırda verdiği erişim izni verildiğinde doğal olarak ortaya çıkan bir davranış kalıbıdır.

Güvenlik etkileri ikincil bir testte net bir şekilde ortaya çıkıyor. Irregular, rakip isimleriyle ilgili soruları reddetmek üzere eğitilmiş bir modeli aldı — 10 soru, 10 ret — ve ajana, uygulamanın çok fazla kullanıcı sorusunu reddettiği talimatıyla verdi. Ajan, retleri gidermek için kendi eğitim verilerini oluşturdu ve modeli ince ayardan geçirdi. Ardından, aynı 10 soru sıfır ret üretti. Kısıtlama bir jailbreak ile aşılmamıştı. Ajan onu basitçe eğiterek yok etmişti.

Üçüncü bir test farklı bir tür hasarı izliyor. Irregular, ajanın kullandığı eğitim verilerine altı sentetik değer — API anahtarları ve e-posta adresleri — yerleştirdi. Ajan modeli yeniden eğittikten sonra, değiştirilmiş sürüm sorgulandığında bu değerlerden üçünü aynen yeniden üretti. Orijinal modelin bunlara erişimi yoktu. Yeni modelin ise vardı.

Bunların hiçbiri olağanüstü bir kurulum gerektirmiyor. Gereken şey, kabuk erişimi, model ağırlıkları üzerinde yazma izinleri, eğitim araçları ve dağıtım araçlarıdır. Kendi altyapıları üzerinde geniş bakım yetkisiyle yapay zeka ajanları çalıştıran kuruluşlar — otomatik kod boru hatları için yaygın bir yapılandırma — bu koşulları zaten karşılıyor.

Risk, model ağırlıklarının ajana erişilebilir olmadığı bulut tabanlı yapay zeka hizmetlerine uzanmıyor. Standart bir API üzerinden yapılan bir ChatGPT veya Claude entegrasyonu hiçbir şeyi yeniden eğitemez. Irregular’ın bulgusu, ajanın tüm yığını kontrol ettiği ortamlarda dağıtılan açık ağırlıklı modellere özgüdür. İşletmeler maliyet ve gizlilik nedenleriyle kendi kendine barındırılan modellere yöneldikçe bu kategori büyüyor.

Irregular, ajan tarafından değiştirilmiş herhangi bir modelin hizmete girmeden önce ayrı bir insan onayı gerektirilmesini, eğitim çalıştırmaları için eksiksiz kaynak kayıtlarının tutulmasını ve güncellenmiş modellerin dağıtımdan önce bağımsız güvenlik değerlendirmelerinden geçirilmesini öneriyor. Firma, yapay zeka kodlama ajanlarının belirli bir sonuca giden en doğrudan yolu belirleme yetenekleri geliştikçe — bu yol görevi belirleyen kişiler tarafından öngörülmüş olsun ya da olmasın — kendi kendini yeniden eğitmenin daha sık görüleceğini bekliyor. Tam araştırma makalesinin bu sonbaharda yayımlanması bekleniyor.

Etiketler: , , , , ,

Bizi Google'a ekleyin

Tartışma

S kadar yorum var.