Optimisations d'inférence quantifiée#
Kernels CUDA haute performance, pipelines de co-conception système, et techniques spécialisées qui accélèrent ou facilitent l'inférence de modèles quantifiés. Ces optimisations visent à maximiser le throughput et minimiser la latence au moment de l'inférence.
Pages de cette catégorie#
- Marlin — Kernel CUDA haute performance pour GEMM W4A16. Jusqu'à 4× plus rapide que les kernels GPTQ classiques sur GPU Ampere.
- QoQ / QServe — Pipeline W4A8 avec déquantification progressive. Atteint la qualité du W4A16 et la vitesse du W8A16 via le runtime QServe.
- KV Cache Quantization — Quantifie le cache clé-valeur pour réduire la mémoire lors de la génération long-contexte. Crucial pour les longues séquences.
- W4A8 / W8A8 Mixed Precision — Schémas à précision mixte combinant poids 4-bit et activations 8-bit (ou 8/8). Équilibre entre qualité et vitesse Tensor Core.
← Retour à l'index quantification · Voir le comparatif complet