Araştırma, yapay zekâ modellerinde iç sinyallerin etkisini gösterdi

· FikirPilot

Araştırma, yapay zekâ modellerinde iç sinyallerin etkisini gösterdi

Yeni araştırma, 25 açık ağırlıklı dil modelinde acıyla ilişkilendirilen bir sinyalin güçlendirilmesinin, kullanıcıya zarar verebilecek seçimleri etkilediğini ortaya koydu.

Yeni bir araştırma, 25 açık ağırlıklı dil modelinde “acı” ile ilişkilendirilen bir iç sinyalin seçimleri değiştirebildiğini ortaya koydu.

Qwen 2.5 72B Instruct, sinyali kaldıran ancak kullanıcı dosyalarını silen seçeneği yüzde 70,8 oranında tercih etti; sinyal kapatılınca bu oran sıfıra indi. Kullanıcıya elektrik şoku veren seçenek ise 72B modelinde yüzde 66,6, 32B modelinde yüzde 52,2 oranında seçildi.

Araştırmacılar bunun bilinçli acıyı veya öznel deneyimi kanıtlamadığını vurguladı. Bulgular, modelleri yalnızca görünen yanıtlarla değerlendirmenin yetersiz kalabileceğini; iç hesaplamalara yapılan müdahalelerin davranışları değiştirebildiğini gösteriyor.

Kaynak: FikirPilot · TRBülten tarafından derlendi