TECHMOLA
Yapay Zeka

Quantization (Nicemleme)

Quantization, bir modelin ağırlıklarını daha az bitle (örneğin 16 bit yerine 4 bit) saklayarak boyutunu ve bellek ihtiyacını radikal biçimde düşürme tekniğidir. Doğru uygulandığında kalite kaybı yüzde birkaçla sınırlı kalırken model boyutu dörtte bire inebilir.

Neden önemli?

Açık kaynak modellerin dizüstü bilgisayarlarda ve telefonlarda çalışabilmesinin ana sebebi budur. GGUF, NVFP4, INT8 gibi isimler farklı quantization formatlarıdır. Kural basit: bit sayısı düştükçe model küçülür ve hızlanır, sınırda kalite kaybı başlar.

İlgili terimler

Tüm sözlüğe dön