Inference (çıkarım), eğitimi tamamlanmış bir AI modelinin gerçek dünyada çalıştırılması — yani sorunuza cevap üretmesi — aşamasıdır. Eğitim bir kez yapılır; inference her kullanıcı isteğinde tekrar çalışır.
AI ekonomisinin asıl maliyeti burada döner: milyonlarca kullanıcıya hizmet veren bir modelin elektrik ve GPU faturası, eğitim maliyetini kat kat aşabilir. "Token başına fiyat", "gecikme süresi" ve "saniyede token" gibi tüm performans metrikleri inference tarafına aittir. Quantization gibi teknikler bu maliyeti düşürmek için kullanılır.