Méthodes de quantification avancées#

Techniques de recherche récentes poussant les limites de la compression (2-4 bits par poids). Ces méthodes utilisent des approches sophistiquées — code-books additifs, optimisation semi-quadratique, traitement d'incohérence, regroupement dense-clairsemé — pour maintenir la qualité à très basse précision.

Pages de cette catégorie#

  • QuIP (Quantization with Incoherence Processing) — Applique un traitement d'incohérence (rotation aléatoire) pour rendre poids et bases plus uniformes, permettant une quantification à très basse précision (2-4 bits).
  • AQLM (Additive Quantization for LLMs) — Quantification additive par code-book. Compresse à 2-bit avec une dégradation minime, au prix d'un encodage coûteux.
  • HQQ (Half-Quadratic Quantization) — Quantification sans données de calibration, basée sur l'optimisation semi-quadratique. Rapide et flexible pour W8/W4/W2.
  • SqueezeLLM — Quantification non-uniforme sensible à la sensibilité (sensitivity based) avec regroupement dense-et-clairsemé. 3-4 bits avec préservation de qualité.
  • SpQR — Sparse-Quantized Representation. Isole les valeurs aberrantes et quantifie le reste à 3-4 bits. Reconstruction quasi-lossless.
  • OmniQuant — Optimisation couche par couche des paramètres de quantification (scale, zero-point, clipping). Uniformise poids et activations simultanément.
  • Outlier Suppression — Suppression des valeurs aberrantes des activations via normalisation par canal avant quantification. Prérequis pour W8A8 stable.

← Retour à l'index quantification · Voir le comparatif complet

ia llm quantification avancees quip aqlm hqq squeezellm spqr omniquant outlier-suppression