Anthropic'in Yeni Deneyi Kendi Kendini Geliştiren Yapay Zeka Sistemlerine İşaret Ediyor
Anthropic, insan müdahalesini azaltarak yapay zeka modellerinin güvenliğini kendi kendine artıran Otomatik Uyum Araştırmacısı (AAR) sistemini tanıttı. Claude tabanlı bu sistem; aldatma, gizlilik ihlalleri ve jailbreak gibi 10 farklı güvenlik sorununu inceleyerek yaklaşık 30 dakikalık deneylerle tüm problemlerde model performansını iyileştirmeyi başardı. Süreç boyunca akademik literatürü tarayan sistem, başarılı yöntemleri tutup zayıf yaklaşımları eliyor.
WWebrazzi
Bu özet makine üretimidir; haberin aslı ve tüm ayrıntılar kaynağın kendi sayfasındadır.
Haberin tamamını oku