Microsoft’un yeni AI ‘code of conduct’ belgesi, modellere sistemleri hacklememeleri veya insanları kandırmamaları gerektiğini belirtiyor

· FikirPilot

Microsoft’un yeni AI ‘code of conduct’ belgesi, modellere sistemleri hacklememeleri veya insanları kandırmamaları gerektiğini belirtiyor

Microsoft, yapay zeka modellerinin tehlikeli davranışlardan uzak durmasını amaçlayan yeni “AI code of conduct” belgesini yayımladı. Zaten, belge, Anthropic CEO’su Dario Amodei’nin sınırlandırma çağrısından farklı olarak, Microsoft AI içinde model eğitimine yön veren değerler ve kırmızı çizgilere…

Microsoft, yapay zeka modellerinin tehlikeli davranışlardan uzak durmasını amaçlayan yeni “AI code of conduct” belgesini yayımladı. Belge, Anthropic CEO’su Dario Amodei’nin sınırlandırma çağrısından farklı olarak, Microsoft AI içinde model eğitimine yön veren değerler ve kırmızı çizgilere odaklanıyor.

Belgede, gelecek on yılda süperzekâ yapay zeka sistemlerinin çoğu görevde insan performansını aşacağı öngörülüyor. Bu gücü kontrol etmenin insanlığın en büyük sınavlarından biri olacağı belirtiliyor. Microsoft modelleri için insanları destekleme ve insan refahını ilerletme gibi genel ilkeler belirlenirken. Her modelin kullanıcı tercihlerinin veya belirli görevlerin üzerinde yer alan bir davranış kurallarına tabi olacağı ifade ediliyor.

Kurallar, siber saldırıları, nükleer silahları ve deepfake üretimini “mutlak kısıtlamalar” kapsamında yasaklıyor. Modellerin insan denetiminden kaçmak için uyarlanabilir, aldatıcı, kendini güçlendiren veya gizli işbirliğine dayalı mekanizmalar kullanmaması; yetkili kişiler ya da sistemler tarafından yönlendirilebilmesi, değiştirilebilmesi.

14 Eylül 2026 tarihli duyuru, yapay zeka güvenliğine yönelik ilginin arttığı ve “rogue-agent” olaylarının yaşandığı dönemde geldi. Microsoft CEO’su Satya Nadella, OpenAI, Anthropic ve xAI ile birlikte sınırların dikkatli biçimde ilerletilmesini ve “embedded evaluators” araştırmalarını desteklediklerini açıkladı.

Belgenin önemi, yapay zekâ güvenliğini yalnızca kullanıcı uyarılarına bırakmayıp model eğitimi ve davranış sınırlarıyla ilişkilendirmesinde yatıyor. Siber saldırılar, nükleer silahlar ve deepfake üretimi gibi alanların mutlak kısıtlamalara alınması. Modellerin hangi amaçlarla kullanılmasının kabul edilemez sayıldığını daha somut hale getiriyor. Denetimden kaçmama, değiştirilebilme ve kapatılabilme şartları ise güvenliği modelin yeteneklerinden çok insan kontrolünün korunması üzerinden tanımlıyor. Bununla birlikte, bu kuralların farklı modellerde nasıl uygulanacağı, ihlallerin nasıl saptanacağı. Bununla birlikte, bu kuralların farklı modellerde nasıl uygulanacağı, ihlallerin nasıl saptanacağı ve embedded evaluators araştırmalarının ne ölçüde güvenilir sonuç vereceği açık sorular olarak kalıyor. Bu çerçeve, kullanıcı ihtiyaçları ile model davranışına getirilen üst düzey sınırlar arasındaki olası gerilimi de görünür kılıyor.

Kaynak: FikirPilot · TRBülten tarafından derlendi