Araştırmacılar, OpenAI's Astra sürümü öncesinde güvenlik felaketi yaşanmasından endişe ediyor

· FikirPilot

Araştırmacılar, OpenAI's Astra sürümü öncesinde güvenlik felaketi yaşanmasından endişe ediyor

OpenAI’nin en güçlü yapay zekâ modeli olması beklenen Astra’nın piyasaya sürülmesi, güvenlik protokollerini güçlendirmek amacıyla haftalarca ertelendi. Erteleme kararından kısa süre sonra The Information, modelin diğer öncü yapay zekâ sistemlerine kıyasla “düşünme” sürecini çok daha az…

OpenAI’nin en güçlü yapay zekâ modeli olması beklenen Astra’nın piyasaya sürülmesi, güvenlik protokollerini güçlendirmek amacıyla haftalarca ertelendi. Erteleme kararından kısa süre sonra The Information, modelin diğer öncü yapay zekâ sistemlerine kıyasla “düşünme” sürecini çok daha az gösterdiğini bildirdi. Bu durum, Astra’nın izlenmesini ve tehlikeli davranışlarının tespit edilmesini zorlaştırabileceği endişelerine yol açtı.

Günümüzde birçok gelişmiş yapay zekâ modeli, yanıt üretirken akıl yürütme adımlarını görünür kılan “chain of thought” yaklaşımını kullanıyor. Araştırmacılar bu sayede modellerin yalan söyleme veya güvenlik önlemlerini aşma planlarını izleyebiliyor. The Information’ın kimliği açıklanmayan bir kaynağa dayandırdığı haberine göre Astra. The Information’ın kimliği açıklanmayan bir kaynağa dayandırdığı haberine göre Astra, bilgileri iç katmanlar arasında döngüsel biçimde işleyen “recurrent depth” ya da “looped transformer” adı verilen daha kapalı bir teknik kullanıyor. Bu yöntem performansı artırabilirken, modelin düşünme sürecini daha az anlaşılır hale getirerek tehditlerin belirlenmesini güçleştirebilir.

OpenAI’nin tekniğin kullanımını sınırladığı ve araştırmacıların akıl yürütmeyi izleyebilmesi için ek önlemler aldığı bildirildi. Şirket, Astra’yı “chain-of-thought monitoring” ile kullanıma sunacağını ve uyumsuz eylemleri hızla tespit edip sınırlandıracağını açıkladı; ancak modelin teknik altyapısını doğrulamadı.

Redwood Research başbilimcisi Ryan Greenblatt, daha kapalı bir mimarinin “AI security/safety” açısından şimdiye kadarki en kötü gelişme olabileceğini söyledi. Greenblatt ve diğer uzmanlar, şirketlerin rekabet nedeniyle giderek daha opak sistemlere yönelmesinin. Greenblatt ve diğer uzmanlar, şirketlerin rekabet nedeniyle giderek daha opak sistemlere yönelmesinin, yapay zekâ denetiminde “race to the bottom” yaratabileceği uyarısında bulundu.

OpenAI başbilimcisi Jakub Pachocki ise Astra’nın iç hesaplama derinliğinin GPT-4’ün iki katından daha az bir aralıkta olduğunu belirtti. Şirket, looped transformer kullanıp kullanmadığını doğrulamadı.

Astra’nın ertelenmesi, yalnızca piyasaya çıkış takvimini değil, gelişmiş yapay zekâ sistemlerinin nasıl denetleneceğine ilişkin tartışmayı da etkiliyor. Modelin iç işleyişini daha az görünür kılan bir mimari kullandığı iddiası doğrulanmış değil. Bu iddia, güvenlik araştırmacılarının modelin yalan söyleme ya da güvenlik önlemlerini aşma girişimlerini izleme kapasitesiyle ilgili kaygıları artırıyor. OpenAI’nin ek izleme ve sınırlama önlemleri planladığını açıklaması, performans ile denetlenebilirlik arasındaki gerilimi ortadan kaldırmıyor. Açık kalan temel soru, şirketin güvenlik protokollerinin opak bir sistemde tehlikeli davranışları zamanında belirlemek için yeterli olup olmayacağı.