Eğitim verisi, bir modelin parametrelerini öğrendiği veri kümesidir. Modelin bildiği her şey buradan geliyor. Sınıflandırma gibi gözetimli görevlerde her örneğin yanında beklenen çıktı da bulunuyor, dil modellerinin ön eğitiminde ise etiket metnin kendisinden çıkarılıyor: model bir sonraki token'ı tahmin etmeye çalışıyor ve doğru cevap zaten cümlenin devamında yazıyor.
Verinin miktarı kadar bileşimi de belirleyici. Kümede hangi konular ağır basıyorsa model orada daha iyi çalışıyor. Türkçe içeriğin oranı düşükse Türkçe performans düşük kalıyor, belirli bir sektörün terminolojisi hiç geçmiyorsa model o terimleri tanımıyor. Bu yüzden veri toplama işi çoğu projede modelleme kadar zaman alıyor.
Hazırlık birkaç adımdan geçiyor. Tekrar eden kayıtların ayıklanması, bozuk ve alakasız içeriğin çıkarılması, kişisel verinin temizlenmesi ve test kümesiyle örtüşen örneklerin çıkarılması bunların içinde. Son adım atlanırsa ölçüm gerçekte olduğundan iyi görünüyor.
Somut bir örnek: bir sigorta şirketi hasar dosyalarını sınıflandıran bir model eğitiyor. Eğitim verisi son üç yılın dosyalarından geliyor, ama bu dönemde bir ürün hiç satılmamış. Model canlıya alındığında o ürüne ait dosyaları tanımıyor, çünkü eğitim sırasında böyle bir örnek görmemiş.
Verideki önyargı da modele geçiyor. Geçmiş kararlar belirli bir grubu sistematik olarak dezavantajlı bırakmışsa, model bu deseni öğrenip sürdürüyor.





