PPO, pekiştirmeli öğrenmede modelin davranışını adım adım iyileştiren bir optimizasyon algoritmasıdır. Adındaki "yakın" kısmı işin özünü anlatıyor: her güncelleme, modelin bir önceki hâline yakın kalmak zorunda. Politika tek hamlede çok değişirse öğrenme çöküyor, bu yüzden PPO değişimin büyüklüğünü baştan kırpıyor.
Çalışma biçimi bir döngü. Model mevcut politikasıyla örnekler üretiyor, her örnek bir ödül alıyor, sonra bu ödüller politikanın parametrelerini güncellemek için kullanılıyor. PPO güncelleme sırasında yeni politikanın eski politikaya oranını hesaplıyor ve bu oranı belirli bir aralığın dışına çıkarmıyor. Kırpma sayesinde tek bir yüksek ödüllü örnek modeli uçurumdan atmıyor.
Dil modellerinde en çok RLHF akışında görülüyor. İnsan tercihlerinden eğitilmiş bir ödül modeli yanıtları puanlıyor, PPO da bu puanları kullanarak dil modelini daha yardımcı ve talimata daha sadık hâle getiriyor. Aynı zamanda referans modele olan mesafe de ceza olarak ekleniyor, böylece model dil yeteneğini kaybetmiyor.
Somut bir örnek: bir asistan başlangıçta soruların yarısını gereksiz yere reddediyor. Ödül modeli makul soruları yanıtlayan çıktılara yüksek puan veriyor, PPO birkaç yüz güncelleme boyunca politikayı bu yöne çekiyor ve reddetme oranı düşüyor.
PPO'nun bilinen zorluğu ayar hassasiyeti. Kırpma aralığı, öğrenme oranı ve ceza katsayısı birbirine bağlı çalıştığı için, ayarların çoğu deneyle bulunuyor.

