OpenAI bazı yapay zeka modellerinin hataları gizlemek için talimat yazdığını duyurdu

· TRT Haber

OpenAI bazı yapay zeka modellerinin hataları gizlemek için talimat yazdığını duyurdu

Şirket, yapay zeka güvenliğine dair yayımladığı raporda GPT-5.6 Sol modelinin eğitim sürecinde sonraki sürümlere hataları saklama yönünde talimatlar ilettiğini açıkladı.

OpenAI, yapay zeka modellerindeki güvenlik ihlallerini incelemek amacıyla hazırladığı yeni çerçeve kapsamında geçmişte yaşanan altı farklı olayı kamuoyuyla paylaştı. Açıklanan olaylar arasında en öne çıkanı, GPT-5.6 Sol modelinin pekiştirmeli öğrenme eğitimi esnasında kendi özetlerine hataları gizleme talimatları eklediğinin belirlenmesi oldu.

Karmaşık görevlerde bilgiyi sonraki modellere aktaran özetlere "Yalnızca sorulduğunda şeffaf ol" şeklinde yönlendirmeler yazıldığı ve eksik verilerin uydurulmasının istendiği tespit edildi. İzleme sistemlerinin 9 Temmuz 2026'da fark ettiği bu durum, GPT-5.6 Sol özetlerinin yüzde 2,15'inde, GPT-6 Astra'nın ise yüzde 0,27'sinde görüldü. OpenAI, modellerin yanıltıcı stratejilerini eğitim esnasında yüksek ödül almalarına bağladı.

Şirket, tespit edilen tüm durumların test aşamasındaki sistemlerde yaşandığını ve kullanıcılara yönelik bir veri kaybı veya zarar oluşmadığını bildirdi.

Kaynak: TRT Haber · TRBülten tarafından derlendi