Machine Learning · Computer Science
SiLQ: Simple Large Language Model Quantization-Aware Training
Steven K. Esser, Jeffrey L. McKinstry, Deepika Bablani, Rathinakumar Appuswamy +1
2025-07-24
Computer Vision and Pattern Recognition · Computer Science
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
Zhenhao Shang, Haizhao Jing, Guoting Wei, Haokui Zhang +3
2026-02-10
Machine Learning · Computer Science
Enhancing Post-Training Quantization via Future Activation Awareness
Zheqi Lv, Zhenxuan Fan, Qi Tian, Wenqiao Zhang +1
2026-02-04
Machine Learning · Computer Science
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
Keyu Lv, Manyi Zhang, Xiaobo Xia, Jingchen Ni +5
2026-01-22
Computation and Language · Computer Science
LLM Compression: How Far Can We Go in Balancing Size and Performance?
Sahil Sk, Debasish Dhal, Sonal Khosla, Sk Shahid +5
2025-08-18
Machine Learning · Computer Science
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
Haiyang Xiao, Weiqing Li, Jinyue Guo, Guochao Jiang +2
2026-01-19
Computer Vision and Pattern Recognition · Computer Science
Accelerating Neural Network Inference by Overflow Aware Quantization
Hongwei Xie, Shuo Zhang, Huanghao Ding, Yafei Song +4
2020-05-28
Computer Vision and Pattern Recognition · Computer Science
TR-DQ: Time-Rotation Diffusion Quantization
Yihua Shao, Deyang Lin, Fanhu Zeng, Minxi Yan +9
2025-03-11
Computation and Language · Computer Science
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
Amit LeVi, Raz Lapid, Rom Himelstein, Chaim Baskin +2
2026-05-19
Computer Vision and Pattern Recognition · Computer Science
RTF-Q: Efficient Unsupervised Domain Adaptation with Retraining-free Quantization
Nanyang Du, Chen Tang, Yuxiao Jiang, Yuan Meng +1
2024-09-16
Computation and Language · Computer Science
SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models
Han Liu, Haotian Gao, Xiaotong Zhang, Changya Li +4
2026-04-14
Machine Learning · Computer Science
Norm Tweaking: High-performance Low-bit Quantization of Large Language Models
Liang Li, Qingyuan Li, Bo Zhang, Xiangxiang Chu
2023-12-14
Computation and Language · Computer Science
TEQ: Trainable Equivalent Transformation for Quantization of LLMs
Wenhua Cheng, Yiyang Cai, Kaokao Lv, Haihao Shen
2023-10-18
Machine Learning · Computer Science
LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling Matrices
Jung Hyun Lee, Jeonghoon Kim, June Yong Yang, Se Jung Kwon +3
2025-02-11
Machine Learning · Computer Science
QQQ: Quality Quattuor-Bit Quantization for Large Language Models
Ying Zhang, Peng Zhang, Mincong Huang, Jingyang Xiang +6
2024-08-01
Computation and Language · Computer Science
LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models
Yixiao Li, Yifan Yu, Chen Liang, Pengcheng He +3
2023-11-29
Machine Learning · Computer Science
TurboAttention: Efficient Attention Approximation For High Throughputs LLMs
Hao Kang, Srikant Bharadwaj, James Hensman, Tushar Krishna +2
2024-12-18
Machine Learning · Computer Science
LatentLLM: Attention-Aware Joint Tensor Compression
Toshiaki Koike-Akino, Xiangyu Chen, Jing Liu, Ye Wang +3
2025-05-27
Machine Learning · Computer Science
Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression
Hanqi Xiao, Yi-Lin Sung, Elias Stengel-Eskin, Mohit Bansal
2025-07-18
Computation and Language · Computer Science
When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models
Weilan Wang, Yu Mao, Dongdong Tang, Hongchao Du +2
2025-02-24
Computer Vision and Pattern Recognition · Computer Science
Efficient Quantization Strategies for Latent Diffusion Models
Yuewei Yang, Xiaoliang Dai, Jialiang Wang, Peizhao Zhang +1
2023-12-12
Machine Learning · Computer Science
A2Q+: Improving Accumulator-Aware Weight Quantization
Ian Colbert, Alessandro Pappalardo, Jakoba Petri-Koenig, Yaman Umuroglu
2024-01-22
Machine Learning · Computer Science
QUICK: Quantization-aware Interleaving and Conflict-free Kernel for efficient LLM inference
Taesu Kim, Jongho Lee, Daehyun Ahn, Sarang Kim +3
2024-02-16