TTQ:面向LLM推理的激活感知测试时量化
机器学习
2026-03-25 v1 计算与语言
信号处理
摘要
为解决大型基础模型的巨大计算需求,已引入激活感知压缩技术,无需重新训练。然而,由于这些方法高度依赖校准数据,可能在面对不可见的下游任务时出现领域迁移问题。我们提出一种测试时量化(TTQ)框架,该框架在推理时对大型模型进行压缩,以解决此问题。通过高效的在线校准,激活感知的即时量化能够适应每个提示,无论是哪种下游任务,同时实现推理加速。若干实验表明,TTQ 在现有SOTA基线方法上具有更好的量化性能。
引用
@article{arxiv.2603.19296,
title = {TTQ: Activation-Aware Test-Time Quantization to Accelerate LLM Inference On The Fly},
author = {Toshiaki Koike-Akino and Jing Liu and Ye Wang},
journal= {arXiv preprint arXiv:2603.19296},
year = {2026}
}
备注
25 pages