Eğitim sırasında her ağırlık genelde 16 ya da 32 bitlik kayan noktalı sayı olarak tutulur. Quantization bu ağırlıkları daha düşük hassasiyetle, çoğunlukla 8 bit veya 4 bit tam sayı olarak yeniden yazar ve orijinal aralığı yaklaşık olarak koruyan bir ölçek katsayısı saklar.
Kazanç mekaniktir. Ağırlık başına bit sayısını yarıya indirmek modelin kapladığı belleği de kabaca yarıya indirir. Küçülen ağırlıklar bellek bant genişliğinde daha hızlı hareket eder ve çoğu servis kurulumunda asıl darboğaz oradadır. 16 bitte iki üst seviye GPU isteyen 70 milyar parametreli bir model, 4 bitte çoğu zaman tek GPU'ya sığar.
Kalite düşer, düşüş miktarı yönteme bağlıdır. Eğitim sonrası nicemleme hazır modeli dakikalar içinde dönüştürür ve sohbet yüklerinde genelde yeterlidir. Nicemleme farkındalıklı eğitim düşük hassasiyeti ince ayar sırasında simüle eder, doğruluğu daha iyi korur, karşılığında bir eğitim koşusu ister.
Doğru karar ölçümle verilir. Kendi değerlendirme setinizi her hassasiyet seviyesinde çalıştırın ve eğrinin nerede kırıldığına bakın. Yayınlanan benchmark'lar sizin production yükünüzle nadiren örtüşür.

