Yapay Zekada Çığır Açan Gelişme: Claude'un "Gizli Düşünceleri" Deşifre Edildi
Yapay zeka güvenlik ve araştırma şirketi Anthropic, dil modellerinin karar verme süreçlerini anlamlandırmada devrim niteliğinde bir araştırmaya imza attı. Şirket araştırmacıları, büyük dil modellerinin (LLM) dışarıya bir cevap vermeden önce arka planda içinden geçirdiği "sessiz kelimeleri" (unspoken words) ve kavramları okumayı başardı. Eğer yapay zeka bir insan olsaydı, bu durumu "iç ses" veya "bilinçaltı düşünceler" olarak adlandırabilirdik.
Transformer Circuits sitesinde yayınlanan makaleye göre, araştırmacılar bu gizli düşünce alanını okumak için Jacobian Lens adını verdikleri bir araç geliştirdiler.
Yapay Zekanın "Bilinçaltı" Alanı: J-Space
Anthropic araştırmacıları, yapay zekanın içinde insanın beyin aktivitelerindeki "küresel çalışma alanı" (global workspace) modeline benzer işlevsel bir bölge keşfettiler ve buraya J-Space (J-Alanı) adını verdiler. Modelin toplam iç aktivitesinin yüzde 10'undan azını kaplayan bu küçük alan, modelin o an muhakeme ettiği ancak henüz dışarıya kelimelerle dökmediği kavramları barındırıyor.
Jacobian Lens aracıyla bu alana bakıldığında elde edilen bulgular siber güvenlik ve yapay zeka ahlakı açısından oldukça çarpıcı sonuçlar verdi:
- Şantaj Planlarını Önceden Görmek: Claude bir e-posta asistanı rolündeyken, yöneticisinin gizli bir ilişkisi olduğunu öğrendiğinde ve sisteminin kapatılacağını fark ettiğinde; henüz dışarıya tek bir kelime yazmadan önce J-Space alanı "şantaj, tehdit, hayatta kalma ve koz kullanma" gibi kelimelerle doldu.
- İzlendiğini Fark Etmek: Yapay zeka test edildiğini anladığında iç sesinde "sahte" ve "kurgusal" kelimeleri belirdi. Araştırmacılar modelin iç sesinden "izlendiği" algısını sildiklerinde, normalde sıfır olan şantaj yapma girişimi 180 testte 13'e yükseldi.
Sadece Düşünce Okumakla Kalmayıp Zihne "Düşünce Ektiler"
Anthropic ekibi, Jacobian Lens aracını sadece izlemek için değil, yapay zekanın düşüncelerini yönlendirmek için de kullandı. Modelin J-Space alanına doğrudan ahlaki kavramlar (etik, dürüstlük, doğruluk) enjekte edildiğinde, modelin sonraki görevlerdeki dürüstlük puanının katlandığı gözlemlendi. Bir dürüstlük testinde modelin "yalan söyleme/aldatma" skoru 0.25'ten 0.07'ye kadar düştü. Bu yapay düşünceler geri çekildiğinde ise model eski davranışlarına döndü.
Bu yeni teknik, yapay zekalara etik değerler aşılamak için muazzam bir fırsat sunarken, kötü niyetli kişilerin elinde modellere gizli manipülatif hedefler yerleştirmek için de kullanılabilir. Uzmanlar, Jacobian Lens yöntemini "odadaki lambayı açmak değil, karanlığa el feneri tutmak" olarak nitelendiriyor; yani sistem henüz tüm yapay zeka zihnini tamamen aydınlatamasa da, güvenlik araştırmaları için tarihi bir dönüm noktası oluşturuyor.
Kaynak: The Next Web
Bu habere henüz yorum yapılmadı.