Güvenlik eğitimi modele belirli istekleri reddetmeyi öğretir. Jailbreak, aynı şeyi isterken bu reddi dolanmak için tasarlanmış bir girdidir.
Teknikler birkaç aile altında toplanıyor. Rol yapma kurguları modelden kısıtı olmayan hayali bir karakter gibi yanıt vermesini ister. Varsayımsal kurgular isteği araştırma ya da hikâye bağlamına sarar. Kodlama hileleri isteği base64'e, başka bir dile ya da modelin hâlâ okuyabildiği bir şifreye gizler. Gradyan tabanlı saldırılar ise reddi kabule çeviren bir ek metni otomatik olarak arar. 2023'te bu konuyu ciddileştiren bulgu, bu tür eklerin modeller arasında sıkça taşınabilmesiydi.
Prompt injection'dan ayrımı saldırganın kim olduğudur. Jailbreak'te kullanıcı saldırgandır ve modeli kendi lehine kural dışına çıkarmaya çalışır. Prompt injection'da saldırgan, modelin bir başkası adına okuduğu içeriğe talimat gizler.
Savunmalar problemi çözmez, katmanlar. Çekişmeli eğitim saldırının maliyetini yükseltir, girdi ve çıktı sınıflandırıcıları bilinen kalıpları yakalar, yayın öncesi red team çalışması ise sizin ürününüzde gerçekten önemli olanları bulur.
Ürün tarafında ölçülecek şey saldırının başarı oranı değil, başarılı bir saldırının maliyetidir. Modeliniz hangi bilgilere ve hangi araçlara erişiyorsa, jailbreak'in gerçek etkisi orada belirlenir. Yalnızca metin üreten bir asistan ile kayıt silebilen bir agent arasındaki fark, aynı açığın çok farklı iki sonuca çıkması demektir.

