Méthodes de quantification avancées#
Techniques de recherche récentes poussant les limites de la compression (2-4 bits par poids). Ces méthodes utilisent des approches sophistiquées — code-books additifs, optimisation semi-quadratique, traitement d'incohérence, regroupement dense-clairsemé — pour maintenir la qualité à très basse précision.
Pages de cette catégorie#
- QuIP (Quantization with Incoherence Processing) — Applique un traitement d'incohérence (rotation aléatoire) pour rendre poids et bases plus uniformes, permettant une quantification à très basse précision (2-4 bits).
- AQLM (Additive Quantization for LLMs) — Quantification additive par code-book. Compresse à 2-bit avec une dégradation minime, au prix d'un encodage coûteux.
- HQQ (Half-Quadratic Quantization) — Quantification sans données de calibration, basée sur l'optimisation semi-quadratique. Rapide et flexible pour W8/W4/W2.
- SqueezeLLM — Quantification non-uniforme sensible à la sensibilité (sensitivity based) avec regroupement dense-et-clairsemé. 3-4 bits avec préservation de qualité.
- SpQR — Sparse-Quantized Representation. Isole les valeurs aberrantes et quantifie le reste à 3-4 bits. Reconstruction quasi-lossless.
- OmniQuant — Optimisation couche par couche des paramètres de quantification (scale, zero-point, clipping). Uniformise poids et activations simultanément.
- Outlier Suppression — Suppression des valeurs aberrantes des activations via normalisation par canal avant quantification. Prérequis pour W8A8 stable.
← Retour à l'index quantification · Voir le comparatif complet