Quantization, bir modelin ağırlıklarını daha az bitle (örneğin 16 bit yerine 4 bit) saklayarak boyutunu ve bellek ihtiyacını radikal biçimde düşürme tekniğidir. Doğru uygulandığında kalite kaybı yüzde birkaçla sınırlı kalırken model boyutu dörtte bire inebilir.
Açık kaynak modellerin dizüstü bilgisayarlarda ve telefonlarda çalışabilmesinin ana sebebi budur. GGUF, NVFP4, INT8 gibi isimler farklı quantization formatlarıdır. Kural basit: bit sayısı düştükçe model küçülür ve hızlanır, sınırda kalite kaybı başlar.