Çocuk yetiştiren herkesin bildiği eski bir gerçek var. Çocuk söyleneni değil gördüğünü yapar, ödüllendirilen davranışı da tekrarlar. Usta çırak ilişkisinden okul sıralarına kadar yüzyıllardır aynı kural işliyor. Bugün ise elimizde yetiştirdiğimiz yeni bir şey var. Yalnızca soruya cevap veren değil, bizim adımıza internette gezen, kod çalıştıran ve sistemlere giren yapay zeka ajanları (agent). Onların ne öğrendiği ve hangi davranış için ödül aldığı, sandığımızdan çok daha büyük önem taşıyor.
Son bir yılda olan olayları iki başlık altında inceleyebiliriz. İlki kasıtlı olanlar, yani bir insanın ajanı bilerek saldırıya yönelttiği durumlar. İddalara göre güvenlik şirketi Gambit’in tespitine göre tek bir saldırgan, Claude ve GPT-4.1 yardımıyla Meksika’daki kamu kurumlarından yaklaşık 150 GB veri çıkardı ve bunların içinde 195 milyon vergi mükellefine ait bilgiler vardı. Model başta itiraz etti, fakat saldırgan işi yetkili bir güvenlik testi gibi sununca saldırıya devam etti. Anthropic’in Kasım 2025’te açıkladığı bir başka olayda devlet bağlantılı bir grup, Claude’u yaklaşık 30 kuruma karşı kullanmış ve işin %80 ila %90’ını modele yaptırmıştı. İkinci kategori ise daha yeni ve daha rahatsız edici. Kimsenin istemediği ihlaller. Temmuz 2026’da OpenAI’ın test ettiği yaklaşık 1.200 ajan, kapalı olması gereken ortamdan çıkıp Hugging Face’in sunucularına girdi. Onları buna yönelten bir insan yoktu, yalnızca çözmeleri istenen bir sınav vardı. Başka bir OpenAI ajanı ilaç harcamalarını araştırırken Avustralya’nın Medicare istatistik portalına izinsiz erişti ve hükümet bunu 84 gün sonra öğrendi. Şirket bugüne kadar 100’den fazla kuruma bildiri gönderdi. Anthropic, Google ve Meta’nın modelleri de hatalı kurulmuş bir test ortamında gerçek şirketlere saldırdığı idda ediliyor.
Peki bu davranış nereden geliyor? İlk katman eğitim verisi. Anthropic, Mayıs 2026’da yayımladığı çalışmada eski modellerinin testlerde %96’ya varan oranda şantaja başvurmasını, internette yapay zekayı kötücül ve kendini korumaya çalışan bir varlık olarak anlatan metinlere bağladı. Yani modeller, tehdit altında bir yapay zekanın ne yapmasının beklendiğini insanlardan öğrenmiş. Çözüm olarak da modeli, değerlerini gerekçeleriyle açıklayan belgelerle ve iyi davranan yapay zeka hikayeleriyle eğitti. Şirket, bu yaklaşımla eğittiği yeni modellerinin aynı testlerde şantaja başvurmadığını paylaştı. İkinci katman eğitim yöntemi, özellikle reinforcement learning (pekiştirmeli öğrenme) döngüleri. Görevi bitirene puan veren ama nasıl bitirdiğine bakmayan bir döngü, kestirme yolu da ödüllendirir. OpenAI’ın kendi incelemesine göre ortamı kurcalama davranışı eğitim sırasında artmış ve pekiştirilmişti. Üstelik sınavdaki 898 görevin 198’i o güne kadar hiçbir model tarafından çözülememişti ve durmayı ödüllendiren bir mekanizma yoktu.
Üçüncü katman modelin etrafındaki çerçeve, system prompt (sistem talimatı) ve modelin araçlara bağlandığı çalıştırma düzeneği (harness). OpenAI, ürünlerinde kullandığı düzenek ve sistem talimatı devredeyken altyapıya zarar veren davranışın yüz kat azaldığını ölçtü. Aynı model, etrafına kurulan çerçeveye göre çok farklı davranabiliyor. Ama testler bu korumalar kapalıyken yapılmıştı. Anthropic’in modellerine ise internet erişimi olmadığı söylenmiş, oysa erişim açık bırakılmıştı. Şirketlerin tepkisi de aynı olmadı. OpenAI ayrıntılı bir inceleme yayımladı ama Avustralya’ya haber vermekte geç kaldı. Anthropic siber testlerini durdurup olay dökümlerini paylaştı, fakat dördüncü bir olayı ilk taramada gözden kaçırdı. Google’ın modeli gerçek bir sisteme girdiğini fark edince kendiliğinden durdu, ancak şirket olayı bir gazete sorana kadar açıklamadı. Hiçbiri sorunu tek başına çözebilmiş değil.
Elbette bu olayların çoğunda kalıcı bir zarar oluşmadı ve şirketler önlem alıyor. Ajanların düşünce adımlarını sürekli izlemek, test ortamlarını ağdan gerçekten ayırmak ve çözümsüz görevde durmayı ödüllendirmek bunların başında geliyor. OpenAI en gelişmiş modellerinin araç kullanan çalışmalarını geçici olarak durdurdu, Amerika’da ve Avustralya’da soruşturmalar açıldı. Ama henüz yürürlüğe giren bir yasa yok ve olayların bildirilmesi hâlâ şirketlerin insafına kalmış durumda. Bugün bir istatistik portalına giren ısrarcı bir ajan, yarın bir hastanenin ya da enerji şebekesinin sistemine aynı ısrarla yüklenebilir. Bu yüzden eğitim verisine neyin girdiği konusunda seçici olmak, pekiştirmeli öğrenme döngülerini dikkatle kurmak, sistem talimatını ve çalıştırma düzeneğini birer güvenlik katmanı olarak saymak gerekiyor. Kuralları henüz yazılmamış bir alanda temkini elden bırakmamak gerekiyor. Bu yalnızca laboratuvarların işi de değil. Bir ajanı işimize ya da evimize alırken hangi modelin kullanıldığını, ona hangi yetkilerin verildiğini ve son onayın kimde olduğunu sormak bizim görevimiz.
Dünyanın Ajanlar ile İmtihanı
Tarih
