Parametre, bir modelin eğitim sırasında öğrendiği ve tahmin üretirken kullandığı iç değişkendir. Sinir ağlarında bunlar ağırlıklar ve sapma değerleri. Eğitim başlarken rastgele atanıyorlar, her adımda hata sinyaline göre biraz güncelleniyorlar ve sonunda modelin bildiği her şey bu sayılarda saklı kalıyor.
Hiperparametreyle karıştırılmaması gerekiyor. Parametre modelin kendisinin öğrendiği şey, hiperparametre ise eğitimi yürüten kişinin baştan seçtiği ayar: öğrenme oranı, katman sayısı, yığın boyutu. Biri veriden çıkıyor, diğeri karardan.
Dil modellerinde parametre sayısı model boyutunun ölçüsü olarak kullanılıyor. Yedi milyar parametreli bir model ile yüz milyarlık bir model arasındaki fark, hem yetenekte hem çalıştırma maliyetinde kendini gösteriyor. Parametre sayısı doğrudan bellek ihtiyacına dönüşüyor, bu yüzden yerel donanımda hangi modelin çalışabileceği de bu sayıya bakılarak belirleniyor.
Somut bir örnek: bir ekip müşteri desteği için model seçiyor. Büyük model daha iyi cevap veriyor ama her çağrı pahalı ve yavaş. Yedi milyar parametreli bir modele kendi verileriyle ince ayar yapıldığında, dar bir görevde büyük modele yakın sonuç alınıyor ve maliyet belirgin düşüyor.
Parametre sayısı tek başına kalite göstergesi değil. Aynı boyuttaki iki model, eğitim verisinin kalitesine göre çok farklı sonuç verebiliyor.


