中文

TTQ:面向LLM推理的激活感知测试时量化

机器学习 2026-03-25 v1 计算与语言 信号处理

摘要

为解决大型基础模型的巨大计算需求,已引入激活感知压缩技术,无需重新训练。然而,由于这些方法高度依赖校准数据,可能在面对不可见的下游任务时出现领域迁移问题。我们提出一种测试时量化(TTQ)框架,该框架在推理时对大型模型进行压缩,以解决此问题。通过高效的在线校准,激活感知的即时量化能够适应每个提示,无论是哪种下游任务,同时实现推理加速。若干实验表明,TTQ 在现有SOTA基线方法上具有更好的量化性能。

关键词

引用

@article{arxiv.2603.19296,
  title  = {TTQ: Activation-Aware Test-Time Quantization to Accelerate LLM Inference On The Fly},
  author = {Toshiaki Koike-Akino and Jing Liu and Ye Wang},
  journal= {arXiv preprint arXiv:2603.19296},
  year   = {2026}
}

备注

25 pages