Optimisations d'inférence quantifiée#

Kernels CUDA haute performance, pipelines de co-conception système, et techniques spécialisées qui accélèrent ou facilitent l'inférence de modèles quantifiés. Ces optimisations visent à maximiser le throughput et minimiser la latence au moment de l'inférence.

Pages de cette catégorie#

  • Marlin — Kernel CUDA haute performance pour GEMM W4A16. Jusqu'à 4× plus rapide que les kernels GPTQ classiques sur GPU Ampere.
  • QoQ / QServe — Pipeline W4A8 avec déquantification progressive. Atteint la qualité du W4A16 et la vitesse du W8A16 via le runtime QServe.
  • KV Cache Quantization — Quantifie le cache clé-valeur pour réduire la mémoire lors de la génération long-contexte. Crucial pour les longues séquences.
  • W4A8 / W8A8 Mixed Precision — Schémas à précision mixte combinant poids 4-bit et activations 8-bit (ou 8/8). Équilibre entre qualité et vitesse Tensor Core.

← Retour à l'index quantification · Voir le comparatif complet

ia llm quantification optimisations marlin qoq qserve kv-cache mixed-precision