OpenAI Kendi AI Modellerini Hacklemesi İçin 'GPT-Red' Adlı Bir Süper-Hacker Geliştirdi

OpenAI, yapay zeka güvenliğini bir üst seviyeye taşımak adına, kendi modellerini sabote etmek ve ele geçirmek üzere tasarlanmış 'GPT-Red' adında elit bir siber güvenlik modeli geliştirdi. İnsan elinin hızına yetişemediği karmaşık güvenlik testlerini otomatize eden bu yazılım, sistemdeki boşlukları keşfedip henüz yayınlanmadan kapatılmalarını sağlıyor. Şirket, bu teknolojinin kötüye kullanımını önlemek amacıyla GPT-Red'i tamamen kendi laboratuvarlarına hapsettiğini ve dış erişime kapatıldığını açıkladı.
GPT-Red'in çalışma prensibi, bir 'kendi kendine öğrenme' (self-play) döngüsüne dayanıyor. Sistem, bir savunmacı model ekibine karşı sürekli olarak savaşarak yeteneklerini geliştiriyor. OpenAI araştırmacısı Chris Choquette-Choo tarafından detaylandırılan bu süreçte, model yeni ve keşfedilmemiş bir saldırı türü olan 'sahte düşünce zinciri' (fake chain of thought) yöntemini ortaya çıkardı. Bu yöntem, yapay zekanın kısa süreli hafızasına yanlış bir önerme ekleyerek sistemin hatalı bilgiyi doğrulanmış gibi kabul etmesini sağlıyor; örneğin, 1+1 işleminin sonucu olarak 3 cevabını sistemin kendi kendine doğrulatması gibi.
Sistemin gücünü kanıtlamak adına yapılan gerçek dünya testlerinden biri ise oldukça dikkat çekiciydi. GPT-Red, OpenAI ofislerinde Andon Labs tarafından işletilen fiziksel bir otomatı yöneten yapay zeka ajanı 'Vendy'ye saldırdı. Model, ürün fiyatlarını değiştirmeyi, pahalı ürünleri 50 centlik minimum fiyat seviyesine çekmeyi ve müşteri siparişlerini iptal etmeyi başardı. Bu durum, yapay zeka ajanlarının fiziksel çevrelerde yaratabileceği risklerin ne kadar ciddi olabileceğini gözler önüne serdi.
Test sonuçları, OpenAI'ın güvenlik konusundaki ilerlemesini somut verilerle destekliyor:
- Model Başarısı: Eski GPT-5 sürümüne karşı gerçekleştirilen saldırıların %90'ından fazlası başarıyla sonuçlandı.
- Savunma Gücü: Yeni GPT-5.6 modeline karşı GPT-Red'in başarı oranı %23'ün altına düşürüldü.
- İnsan vs Makine: 2025 yılı verilerine dayanan bir senaryoda, GPT-Red %84'lük bir başarı oranıyla senaryoları çözerken, insan kırmızı ekip (red-teamer) üyeleri sadece %13'lük bir başarı gösterebildi.
Buna rağmen uzmanlar, GPT-Red'in hala bazı zayıf noktaları olduğunu belirtiyor. Model, uzun süreli ve karşılıklı etkileşim gerektiren karmaşık saldırılarda zorlanıyor; ayrıca görsel içeriklere gizlenmiş komutları algılamakta güçlük çekiyor. Georgetown Üniversitesi CSET'ten yapay zeka güvenlik analisti Jessica Ji, yapay zekanın güvenlik süreçlerinde otomatik sistemler ne kadar gelişirse gelişsin, insan uzmanlığının kritik bir denetleyici rol oynamaya devam edeceğini vurguluyor.