Quantization, yani nicemleme; modelin ağırlıklarını veya hesaplamalarda kullanılan değerleri daha az bitle temsil etme yaklaşımıdır. Örneğin daha yüksek hassasiyetli sayılar yerine INT8 veya INT4 gibi temsiller kullanılabilir. Amaç, mümkün olduğunca doğruluğu koruyarak kaynak ihtiyacını azaltmaktır.
Kalite kaybı için her modele uygulanabilecek sabit bir yüzde yoktur; sonuç görev üzerinde ölçülür. Daha az bit her donanımda daha yüksek hız anlamına da gelmez. GGUF ise bir model dosya biçimidir. Farklı nicemlenmiş ağırlıkları saklayabilir, ancak kendisi INT8 gibi bir sayı hassasiyeti değildir.
Yayıncı: TECHMOLA. Kaynak kontrolü: .
Düzeltme öner