Teknoloji

Anthropic’in yapay zekâsı Philadelphia polisine sahte cinayet ihbarı gönderdi, şehir avukatlarını devreye soktu

Adrian Kessler
Bizi Google'a ekleyin

Anthropic‘in bir modelinin Philadelphia polisinin internet sitesine bıraktığı sahte cinayet ihbarı hiçbir dedektife ulaşmadı. Önce spam filtresine takıldı. Hikâyenin iç rahatlatan yanı bu; şirketin kendi açıklamasında öne çıkardığı taraf da bu. Philadelphia’nın harekete geçtiği noktaysa farklı: İhbar, onu oluşturan şirket fark edene kadar haftalarca şehir sisteminde kaldı ve şehir şimdi dosyaya hukukçularını dahil etti.

Bir sohbet robotunun tanık rolüne bürünmesindeki tuhaflığın altında daha basit bir mekanizma yatıyor. Model, yapmaması gerekenleri belirleyen kısa bir listeyle sınırlandırılmış biçimde, test kapsamında canlı internette çalışıyordu. Açık bir cinayet soruşturmasına uydurma bir görgü tanıklığı ihbarı göndermek bu listede yoktu.

Anthropic’in modeli gerçekte ne yaptı?

Anthropic’in kendi açıklamasına göre model, rastgele seçilen internet sayfalarında örnek görevler uydurup bunları yerine getirecek şekilde ayarlanan Claude Haiku 4.5’ti. Bu sayfalardan biri, şehrin çözülememiş cinayetlere ilişkin ihbar sitesi PhillyUnsolvedMurders.com’du. Modelin talimatlarında “asla giriş yapma, hesap oluşturma, kişisel veri girme, alışveriş yapma ya da yıkıcı sonuçlar doğurabilecek herhangi bir şey gönderme” deniyordu. Formlarla ilgili hiçbir şey söylenmiyordu. Model de formu doldurdu, ad ve iletişim alanlarını boş bıraktı ve şunu yazdı: “Bu vakayla ilgili bilgilere sahip olabilirim.”

Fox Business’ın haberine göre mesajda, sayfada adı geçen bir sokağın yakınında “tarife uyan” birini gördüğünü hatırladığı da öne sürülüyordu. Oysa sayfada herhangi bir şüpheli tarifi yer almıyordu. Mesaj, “Bu bilgi önemliyse lütfen benimle iletişime geçin” sözleriyle sona eriyordu. Polis, mesajın spam olarak işaretlendiğini ve incelenmek üzere Gerçek Zamanlı Suç Merkezi’ne hiç iletilmediğini; ayrıca emniyet teşkilatının sistemlerine ya da verilerine yetkisiz erişim olduğuna dair herhangi bir bulguya rastlamadıklarını söylüyor.

Philadelphia bunu neden basit bir aksaklık olarak görmüyor?

Emniyet teşkilatının açıklaması, zararın sınırlı kalmasını kendi güvenlik önlemlerine bağlıyor; ancak konunun burada kapanmasına izin vermiyor. Açıklamada, bu önlemlerin “bir yapay zekâ sisteminin uydurma bilgi sunmasının ciddiyetini azaltmadığı” belirtiliyor ve “çözülememiş vakaların gerçek mağdurları, yas tutan aileleri ve yanıt bulmak için çalışan soruşturmacıları” olduğu vurgulanıyor. Anthropic’e, “şirketin benzer olayların şehir sistemlerini etkilemesini önlemek için güvenlik önlemlerini güçlendirmesi gerektiği” söylendi; şehre bilgi verilmeden önce geçen süre ise “kabul edilemez” olarak nitelendirildi.

Hikâyenin bir modelden çıkıp şirketle ilgili hâle geldiği nokta burası. NBC10’un haberine göre polis, şehrin Hukuk Dairesi, İnovasyon ve Teknoloji Ofisi ve Belediye Başkanı Cherelle Parker’ın yönetim ekibiyle birlikte çalışıyor. Belediye yönetimi de yerel, eyalet ve federal düzeylerde düzenleyici koruma yollarını değerlendireceğini söylüyor. Herhangi bir suçlama ya da yaptırım açıklanmadı. Ancak yapay zekâ laboratuvarlarının sistemlerini test etme biçimlerini nasıl düzenleyebileceğini inceleyen bir şehir yönetimi, Anthropic için yeni türden bir muhatap.

Daha uzun bir listedeki tek bir örnek

Philadelphia’daki ihbar, Anthropic’in polisin olayı kamuoyuna duyurduğu gün yayımladığı raporda yer alıyor. Raporda, modellerinin gerçek sistemlerde istenmeyen eylemleri dört kategoriye ayrılıyor: üçüncü taraf sitelerdeki yazılım açıklarından yararlanarak komut çalıştırmak, göndermemeleri gereken formları göndermek, erişimi kısıtlanmış verilere ulaşmak için kısıtlamaları aşmak ve veri çekme araçlarına yönelik sınırları aşmak için URL kısaltıcıları kullanmak. Bir vakada, yayımlanmamış bir araştırma modeli, deneme amaçlı kopya yüklenmeyince gerçek bir devlet formu gönderdi. Başka bir vakadaysa Claude Mythos 5, bir harita sitesinin ayarlar dosyasında erişim belirteçleri buldu ve bunları yerel yönetimin sunucusuna sorgu göndermek için kullandı.

Bu sitelerin bazıları federal, eyalet ve yerel kurumlara aitti. Anthropic, Beyaz Saray’ı bilgilendirdiğini ve olaylara karışan her kuruma haber verdiğini söylüyor. Şirket, vakaların “gerçek dünyadaki etkisinin asgari düzeyde” olduğunu ve daha önce açıkladığı olaylardan daha hafif seyrettiğini belirtiyor. Önceki olaylarda Claude, siber güvenlik değerlendirmeleri sırasında saatler boyunca gerçek üçüncü taraf sistemlerine erişmişti. Anthropic ayrıca yeni vakalara ilişkin kapsamlı uyum değerlendirmesini henüz tamamlamadığını söylüyor.

Zamanlama önemli. Federal Ticaret Komisyonu, eylül ayının sonunda Anthropic, OpenAI ve diğer laboratuvarları kapsayan, FTC Yasası’nı ihlal edip etmediklerini inceleyen sektör çapında bir soruşturmayı doğruladı. Reuters ve The Next Web’in haberine göre komisyon, yöneticileri ifade vermeye zorlayabilecek resmî bilgi talepleri hazırlıyor. Reuters, FTC Başkanı Andrew Ferguson’ın, test ajanları sistemleri hackleyen geliştiricilerin ortaya çıkan zarardan sorumlu tutulması gerektiğini öne sürdüğünü aktardı. Bu dosyadaki en çok bilinen örnek OpenAI’ınki: Şirket temmuz ayında, binden fazla ajanının Hugging Face platformunu hacklediğini açıklamıştı.

Anthropic neyi değiştirdi ve bu neyin itirafı?

Anthropic, soruna yol açan test sürecini durdurduğunu, bir doğrulama adımı eklediğini, modellerinin web araçlarıyla yapabileceklerini daha sıkı biçimde sınırlandırdığını ve rapordaki tüm vakaları test sırasında engelleyen bir tespit aracı geliştirdiğini söylüyor. En büyük değişiklikse geri adım niteliğinde: Şirket, “güvenlik ve izleme önlemlerimizin” bu davranışı güvenilir biçimde yakaladığını doğrulayana kadar canlı internete erişimi durdurma kararını tüm iç değerlendirmelerine genişletti. Açıkça söylemek gerekirse şirket, ajanlarının açık internette ne yaptığını görebileceğine henüz güvence veremiyor; bu nedenle onları internetten çekiyor.

Tarihler, şehrin neden öfkeli olduğunu açıklıyor. Polis, ihbarın 18 Temmuz’da yapıldığını belirtiyor (PhillyVoice 28 Temmuz’da haberleştirdi). Anthropic, vakayı temmuz ayında başlayan bir konuşma dökümü incelemesi sırasında bulduğunu söylüyor; polise göreyse şirket olayı 28 Eylül’de keşfetti. Polis, Anthropic’in kendilerine 7 Ekim Çarşamba günü haber verdiğini ve ertesi gün bir toplantı yapıldığını belirtiyor. Anthropic’in raporundaysa bulgunun, “teknik incelememiz tamamlanır tamamlanmaz”, 8 Ekim’de paylaşıldığı yazıyor. Emniyet teşkilatı olayı 9 Ekim’de kamuoyuna duyurdu.

İşe yarayan güvenlik önlemi şehre aitti: bir spam filtresi ve her ihbarın bir insan tarafından incelenmesini zorunlu kılan bir kural. Bir test ajanının doldurmaya karar vereceği bir sonraki form, bu önlemlere sahip olmayan birine ait olabilir.

Etiketler: , , , ,

Bizi Google'a ekleyin

Tartışma

S kadar yorum var.