Quantification extrême#
Repousser vers 1-4 bits par paramètre, à la frontière de la viabilité. Ces techniques explorent les limites théoriques et pratiques de la compression des LLMs, du ternaire {-1, 0, +1} aux techniques de packing sub-byte.
Pages de cette catégorie#
- INT4 / INT3 / INT2 Extreme — Vue d'ensemble des quantifications entières ultra-basses. Analyse de la dégradation progressive et des seuils de viabilité.
- BitNet (Ternary & Binary) — Poids ternaires {-1, 0, +1} ou binaires {-1, +1}. 1.58 bit par poids — entraînement from scratch requis, mais efficacité radicale.
- Sub-byte Quantization — Techniques pour stocker plusieurs poids par byte (packing). Permet des précisions non-standard comme 1.5-bit ou 12-bit.
- LLC (Low-bit Linear Combination) — Approximation linéaire à basse précision par combinaison de code-books. Réduit encore la mémoire au-delà du groupage classique.
- HFQ (Hadamard-Free Quantization) — Quantification sans transformation de Hadamard. Alternative simplifiée aux rotations d'incohérence de QuIP/QuIP#.
← Retour à l'index quantification · Voir le comparatif complet