Doğrudan Tercih Optimizasyonu (DPO)

Doğrudan Tercih Optimizasyonu (DPO)


RLHF hizalamayı iki aşamada yapar. Önce insan karşılaştırmaları bir ödül modeli eğitir, sonra pekiştirmeli öğrenme politikayı bu ödüle göre optimize eder ve bir KL cezası politikayı orijinaline yakın tutar. Çalışır, ama kırılgandır. Ödül modelleri kandırılabilir, PPO dikkatli ayar ister ve bütün hat çalıştırması ağır bir yapıdır.

DPO bir kısa yol türetir. Yazarlar, o ödül altındaki en iyi politikanın kapalı bir forma sahip olduğunu gösterdi. Bu da tercih verisinin, sınıflandırmaya benzeyen tek bir kayıp fonksiyonuyla politikayı doğrudan eğitebileceği anlamına gelir. Her eğitim örneği bir prompt ile seçilen ve reddedilen birer yanıttan oluşur. Kayıp fonksiyonu, modelin dondurulmuş bir referans kopyasına göre seçilen yanıtın olasılığını yükseltir.

Ödül modeli yok. Rollout yok. Sıradan ince ayara yeterince yakın olduğu için, elinde tercih verisi olan bir ekip bunu mütevazı donanımda çalıştırabilir.

Sınırlar üst seviyede görünür. DPO yalnızca sabit çiftleri gördüğü için, çevrim içi pekiştirmeli öğrenmenin yaptığı gibi yeni yanıtlar keşfedemez. Kalite, toplanan verinin kapsamıyla tavan yapar.

Özel yapay zekâ modellerinden kurumsal danışmanlık ve arama deneyimlerine kadar projenize güç katın.
Yapay zekâ ekibimizle tanışın