İnsan Geri Bildiriminden Takviyeli Öğrenim (RLHF)

İnsan Geri Bildiriminden Takviyeli Öğrenim (RLHF)


RLHF, bir dil modelinin davranışını insan tercihlerine göre ayarlayan eğitim yaklaşımıdır. Ön eğitimden çıkan model dili iyi biliyor ama nasıl davranması gerektiğini bilmiyor. RLHF bu boşluğu, insanların hangi yanıtı tercih ettiğini modele öğreterek kapatıyor.

Akış üç aşamalı. Önce gözetimli ince ayar yapılıyor: insanların yazdığı örnek diyaloglarla model istenen biçime yaklaştırılıyor. Sonra aynı isteme birkaç yanıt üretiliyor, değerlendiriciler bunları iyiden kötüye sıralıyor ve bu sıralamalardan bir ödül modeli eğitiliyor. Son aşamada PPO gibi bir pekiştirmeli öğrenme algoritması, ödül modelinin puanlarını kullanarak dil modelini güncelliyor. Bu sırada referans modele olan mesafe de cezalandırılıyor, yoksa model puanı yükseltmek için dili bozmaya başlıyor.

Yöntemin çözdüğü şey, ölçülmesi zor niteliklerin eğitime sokulması. Yardımcı olma, talimata sadık kalma, gereksiz reddi azaltma ve zararlı içerikten uzak durma tek bir kayıp fonksiyonuyla yazılamıyor, ama insan tercihiyle sıralanabiliyor.

Somut bir örnek: ön eğitimden çıkan bir model, "bu metni özetle" isteğine özet yerine metnin devamını yazıyor, çünkü öğrendiği şey metni sürdürmek. RLHF sonrasında aynı istekte özet üretiyor, çünkü değerlendiriciler o davranışı tutarlı biçimde tercih etmiş.

Sınırı değerlendirici havuzunun kendisi. Model, kime sorulduysa onun tercihlerini öğreniyor, dolayısıyla havuzdaki eğilimler doğrudan model davranışına geçiyor.

Özel yapay zekâ modellerinden kurumsal danışmanlık ve arama deneyimlerine kadar projenize güç katın.
Yapay zekâ ekibimizle tanışın