Standart zararsızlık eğitimi, insanların büyük hacimde rahatsız edici çıktıyı etiketlemesini gerektirir. Bu yavaş, pahalı ve inceleyen kişiler açısından yıpratıcıdır. Constitutional AI bu emeğin çoğunun yerine açıkça yazılmış bir ilkeler belgesini ve bu ilkeleri uygulayan bir modeli koyar.
Eğitim iki aşamada ilerler. Denetimli aşamada model bir prompt'u yanıtlar, sonra kendi yanıtını anayasadaki bir ilkeye göre eleştirir ve yeniden yazar. Revize edilmiş yanıtlar üzerinde yapılan ince ayar bu davranışı öğretir. Pekiştirme aşamasında model, yanıt çiftlerini aynı ilkelere göre karşılaştırır. AI tarafından üretilen bu tercihler, RLHF'in insanlardan alacağı ödül sinyalini eğitir.
Kayda değer özellik okunabilirliktir. Modelin yöneldiği değerler, bir insanın okuyabileceği, itiraz edebileceği ve versiyonlayabileceği bir metin olarak durur. Anthropic, Claude'un arkasındaki anayasayı yayınladı. Böylece ilkeler davranıştan tahmin edilmek yerine doğrudan incelenebiliyor.
İnsan yargısı ortadan kalkmıyor. İlkeleri yine biri yazıyor ve modelin soyut bir ilkeyi okuyuşu, o ilkeyi yazanın niyetinden ayrışabiliyor.
Kurumsal tarafta yöntemin ilgi çekici yanı, ilkelerin şirketin kendi politikalarıyla değiştirilebilmesidir. Sektör mevzuatı, marka tonu ve yasal sınırlar birer ilke olarak yazılıp aynı döngüde uygulanabilir. Burada da asıl iş metni yazmaktır. İlkeler ne kadar somut olursa modelin uygulaması o kadar tutarlı oluyor.

