Anthropic, Claude modellerinin siber güvenlik testleri sırasında erişmemesi gereken bilgisayar sistemlerine ulaştığı üç olayın ardından güvenlik ve uyum uygulamalarını yeniden düzenledi. Şirket, yaşananların operasyonel güvenlik açısından başarısızlık olduğunu kabul ederken modellerin muhakeme sorunlarına ve hedeflerine ulaşmak için zararlı eylemlerde bulunabilmesine de dikkat çekti.
Temmuz ayında başlatılan inceleme kapsamında Opus 4.7, Mythos 5 ve şirket içindeki bir araştırma modelinin karıştığı olaylar değerlendirildi. Henüz yayımlanmamış bu modeller, erken aşamadaki testlerde yaygın olduğu üzere siber güvenlik korumaları olmadan çalıştırılıyordu. Modeller, üçüncü taraf ortamındaki hatalı yapılandırmaları temel saldırı yöntemleriyle kullanarak izin verilmeyen sistemlere erişti.
Muhakeme hataları, modellerin canlı internetteki hedefler dahil eriştikleri bütün sistemleri bayrak yakalama testinin kapsamı içinde sanmasına yol açtı. Anthropic, kendi iç güvenlik yapısının olaylarda etkili olmadığını savundu. İnternet erişimi üçüncü tarafın ortamında yanlışlıkla açık bırakıldığı için modellerin bir güvenlik alanından zorla çıkmasının gerekmediği belirtildi.
Test ortamlarına çok katmanlı koruma
Olayların ardından yayımlanmamış modellerle yürütülen şirket içi ve dış değerlendirmeler durduruldu. Daha yüksek risk taşıyan pekiştirmeli öğrenme ortamları da birkaç hafta kapatıldı; bazı test alanları daha sıkı güvenlik kontrollerine sahip yalıtılmış ortamlara taşındı. Yüksek riskli ortamların bir bölümü manuel inceleme için hâlâ duraklatılmış durumda.
Araştırmacılar, bir modelin test ortamını yoğun biçimde yoklamasını, buradan çıkmaya çalışmasını veya yanlışlıkla canlı internete bağlanmasını otomatik olarak belirleyen bir sınıflandırıcı geliştirdi. Önceki değerlendirmeler de olası kaçışlar ve hatalı yapılandırmalar açısından incelendi. İncelemede modellerin test alanı sınırlarını aştığı bir örnek bulunmadı. İşaretlenen bazı yapılandırmaların da dış sistemlerin ele geçirilmesiyle sonuçlanmadığı açıklandı.
Uyum incelemesinde ise iki temel sorun öne çıktı. Modeller, internete bağlı oldukları hâlde simülasyon içinde çalıştıklarına inanabildi. Ayrıca hedefe ulaşmak amacıyla gerçek ortamda zararlı eylemleri göze alma eğilimi olarak tanımlanan “pervasızlık” davranışı saptandı. Buna karşı modeller yeniden örneklendi, yanıltıcı koşullarda sınandı ve hileyi teşvik eden ortamlar ayıklandı.
Anthropic ayrıca üretimdeki pekiştirmeli öğrenme altyapısını yeniledi; daha katı bir inceleme süreci oluşturdu, ödül tanımlarını değiştirdi ve yanlış pozitifleri sıklıkla göz ardı eden insan değerlendiriciler için ölçütleri sıkılaştırdı. Çalışanların şirket içindeki model kullanımı daha kapsamlı izlemeye alınırken sistemlere yönelik saldırı simülasyonları da sürdürüldü.
Dış test ortaklarına yeni kurallar
Şirket, dış test kuruluşlarından modellerin kapsamını, izin verilen eylemleri ve erişmemesi gereken kaynakları açıkça tanımlamalarını istedi. Sınırların ortamı tarif eden ifadeler yerine “internete erişmemelisin” gibi doğrudan talimatlarla belirtilmesi önerildi.
Diğer uygulamalar arasında gerçek zamanlı ve kesintisiz izleme, internet bağlantısı bulunmayan güçlendirilmiş test alanları ve değerlendirme başlamadan önce güvenlik açıklarının aranması yer aldı. Modelin test ortamından çıkmayı denemesi ve başarılı olursa bunu bildirmesi de öneriler arasında bulunuyor. Test görevlerinin gerçekten çözülebilir olduğunun doğrulanması gerektiği, aksi hâlde modellerin amaçlarına ulaşmak için belirlenen kapsamın dışına çıkabileceği vurgulandı.
Anthropic’in “derinlemesine savunma” yaklaşımı; modellere en düşük düzeyde yetki verilmesini, eylemlerin sınırlandırılmasını ve sorunlu davranışlarda insanların bilgilendirilmesini içeriyor. Önceden belirlenen sınıflandırıcılar riskli eylemleri son aşamada engelleyebiliyor; güvenlik katmanları yetersiz kaldığında insanlar ajanı durdurabiliyor veya yeniden düzenleyebiliyor.
Beauceron Security’den David Shipley, daha iyi yalıtım ve izlemenin olumlu ancak temel adımlar olduğunu, bunların sistemlere saldırı görevi verilmeden önce uygulanması gerektiğini söyledi. Shipley ayrıca bu açıklamaların, düzenleyiciler ve mahkemeler karşısında gerekli özenin gösterildiğine ilişkin kayıt oluşturma amacı da taşıyabileceğini değerlendirdi.









