Méthodes de quantification populaires#

Les méthodes les plus répandues dans l'écosystème open-source, largement utilisées en production. Ces approches couvrent le spectre allant de l'INT8 sans perte (LLM.int8()) aux formats weight-only INT4 (GPTQ, AWQ) en passant par les formats de fichier grand public (GGUF).

Pages de cette catégorie#

  • LLM.int8() — Par Dettmers et al. Quantification INT8 qui préserve les valeurs aberrantes (outliers) en FP16 via décomposition matricielle. La méthode de référence pour une quantification 8-bit sans perte.
  • SmoothQuant — Lisse les difficultés de quantification entre poids et activations en transférant l'échelle. Permet une quantification W8A8 efficace de bout en bout.
  • GPTQ — Quantification post-entraînement couche par couche basée sur la résolution de problème inverse. Standard de facto pour la quantification W4A16 des LLMs.
  • AWQ (Activation-aware Weight Quantization) — Identifie les canaux de poids « importants » via les activations et applique une mise à l'échelle par canal. Excellente qualité en W4.
  • NF4 / bitsandbytes — Le format NormalFloat 4-bit (NF4) de QLoRA. Idéal pour le fine-tuning efficace en mémoire et l'inférence via la librairie bitsandbytes.
  • GGUF / GGML — Le format de fichier et ses variantes de quantification (Q4_0, Q4_K_M, Q5_K_M, etc.) utilisé par llama.cpp. Le standard pour l'inférence CPU/GPU grand public.

← Retour à l'index quantification · Voir le comparatif complet

ia llm quantification populaires gptq awq smoothquant gguf bitsandbytes llm-int8