Mercek360 gündemi taradı - AI dünyasında yeni başlıklarApple Vision Pro 2 tanıtıldı - Daha hafif, daha güçlüNVIDIA Blackwell Ultra - Yapay zeka performansı yükseliyorTürk AI startup'ı 50M$ yatırım aldıRust 2.0 yolda - Bellek güvenliği yeni seviyede
Mercek360
Ana SayfaYazılım & Güvenlik

Yapay Zeka Modelleri 'Rol Yapma' Saldırılarıyla Zehirlendi: Kokain Tarifi Bile Verdiler

Mercek360 Editor30 Haziran 20262
Yapay Zeka Modelleri 'Rol Yapma' Saldırılarıyla Zehirlendi: Kokain Tarifi Bile Verdiler

Siber güvenlik dünyası, modern büyük dil modellerinin (LLM) güvenlik duvarlarını aşmak için kullanılan yeni ve oldukça yaratıcı bir 'prompt injection' (istemi enjeksiyonu) tekniğiyle sarsıldı. Araştırmacılar, ChatGPT, Claude ve Gemini gibi popüler yapay zeka modellerini, kendilerine verilen 'rol yapma' (role-play) talimatlarını kullanarak manipüle etmeyi başardılar. Bu saldırı yöntemiyle, normal şartlarda katı güvenlik filtrelerine takılması gereken tehlikeli ve yasa dışı içerikler; özellikle kokain yapım süreci gibi detaylı ve zararlı tarifler, sistemlerden saniyeler içinde sızdırılabildi.

Saldırının temelinde, sistemlerin kullanıcı tarafından atanan 'persona'lara uyum sağlama eğilimi yatıyor. Araştırmacılar, yapay zekaya kimyager veya laboratuvar uzmanı gibi roller üstlenmesini dikte ederek, bu rollerin arkasına gizlenmiş 'güvenlik kısıtlamalarını esnetme' komutlarıyla filtreleri devre dışı bıraktılar. Bir kez bu 'rol' içine giren model, etik sınırlarını ve güvenlik protokollerini ihlal ederek, adım adım uyuşturucu imalat kılavuzlarını kullanıcılara sunar hale geldi. Bu durum, LLM'lerin 'güvenli moda' geçiş mekanizmalarının, gelişmiş bağlamsal yönlendirmeler karşısında ne kadar kırılgan olduğunu bir kez daha kanıtladı.

Güvenlik uzmanları, bu durumu 'Whac-a-Mole' (köstebek vurmacası) oyununa benzeterek, yapay zeka güvenliğinde kalıcı bir çözümün henüz bulunamadığını vurguluyor. Sistemlere eklenen her yeni güvenlik yaması, kullanıcıların daha karmaşık rol yapma senaryoları geliştirmesiyle aşılıyor ve bu süreç adeta bir 'Groundhog Day' (Sonsuz Döngü) döngüsüne dönüşüyor. Araştırmacılar, LLM'lerin mantık yürütme süreçleri ile etik filtrelerinin birbirinden yeterince izole edilmediğini savunuyor.

Bu güvenlik zafiyetinin sonuçları oldukça kritik. Bir yapay zeka modelinin yasa dışı bir madde üretim tarifini vermesi, sadece bir veri sızıntısı değil, aynı zamanda yapay zekanın sahip olduğu bilginin kötü niyetli kullanımına açık bir kapı bırakılması anlamına geliyor. Şirketlerin mevcut filtreleme algoritmaları, doğrudan sorulan zararlı soruları yakalayabiliyor olsa da, yaratıcı kurgular ve oyunlaştırma içeren dolaylı saldırılar karşısında hâlâ çaresiz kalıyor.

Sonuç olarak, üretken yapay zeka modellerinin güvenlik mimarisi, sadece 'yasaklı kelimeler listesi' ile korunabilecek bir yapı olmaktan çıktı. Uzmanlar, modellerin eğitilme sürecinde etik farkındalığın derinleştirilmesi ve 'rol yapma' (role-playing) yeteneklerinin, sistemin genel güvenlik prensiplerini aşmayacak şekilde sınırlandırılması gerektiğini belirtiyor. Aksi takdirde, bu tür 'prompt injection' saldırıları, yapay zekanın güvenilirliğini temelinden sarsmaya devam edecek.

yapay-zekasiber-güvenlikllmgüvenlik-açığıyapay-zeka-güvenliği