Mixed-Precision Quantization for Language Models: Techniques and Prospects
The rapid scaling of Language Models (LMs) has resulted in unprecedented computational, memory, and energy requirements, making their training and deployment increasingly unsustainable. Quantization has emerged as a crucial compression technique for reducing model size, alleviating memory bottlenecks, and accelerating inference. However, while uniform low-bit quantization (e.g., INT8, INT4) provides significant efficiency gains, it can degrade accuracy in sensitive components of transformer-based LMs. Mixed-precision quantization offers a promising alternative by selectively allocating precision across layers or within tensors to strike a balance between efficiency and accuracy. This survey provides a comprehensive overview of Mixed-Precision quantization frameworks for LMs (MXPLMs). We first review quantization fundamentals, including uniform and non-uniform quantizers, quantization granularity, and methods widely used in post-training quantization. We then categorize and compare recent MXPLM frameworks according to their bit allocation strategies and precision configurations across weights, activations, and key-value caches. A comparative analysis highlights differences in perplexity, zero-shot task performance, and deployment trade-offs. Furthermore, we contrast MXPLMs with earlier mixed-precision quantization methods for deep neural networks, identifying strategies that transfer and those that face challenges in the LM setting. Then, we discuss quantization-compatible hardware, KV cache and mixture-of-experts quantization, and summarize open issues and future directions, including hardware-aware design, activation quantization, and scalable optimization methods for billion-parameter models.
Authors
- Olga Krestinskaya (ORCID: https://orcid.org/0000-0001-8038-4558)
- Fadi Kurdahi (ORCID: https://orcid.org/0000-0002-6982-365X)
- Ahmed M. Eltawil (ORCID: https://orcid.org/0000-0003-1849-083X)
- Marios Fournarakis
- Jinane Bazzi (ORCID: https://orcid.org/0000-0003-4007-0161)
- K. Saláma (ORCID: https://orcid.org/0000-0001-7742-1282)
- Mariam Rakka (ORCID: https://orcid.org/0000-0002-2514-7960)
- Mohammed E. Fouda (ORCID: https://orcid.org/0000-0001-7139-3428)
Institutions
- Al Ain University (AE)
- University of California, Irvine (US)
- Kootenay Association for Science & Technology (CA)
- Irvine University (US)
- King Abdullah University of Science and Technology (SA)
Publication Details
- Journal
- ACM Computing Surveys
- Published
- 2026-09-16
- DOI
- https://doi.org/10.1145/3848510
- Primary Topic
- Advanced Neural Network Applications
- Type
- article
- Field-Weighted Citation Impact
- 0.00