中文

你只做一件事:基于 LLM 隐藏表示的按任务量化

计算与语言 2026-05-19 v3

摘要

许多 LLM 应用仅需要特定的局限能力,但标准的事后量化(PTQ)方法在分配精度时不考虑目标任务。这会在对任务信号不那么重要的层上浪费比特,同时对下游行为至关重要的层进行过度压缩。我们提出了任务感知量化(TAQ),这是一种无需训练的、仅使用权重的混合精度PTQ框架,利用少量无标记任务校准提示,在固定比特预算下将更高精度分配给与任务相关的变换层。TAQ 从隐藏表示和输出灵敏度估计层的重要性,并通过三种评分规则进行实例化:基于激活信息和稳定性的 TAQ-IS;基于量化噪声代理下的输出分布灵敏度的 TAQ-KL;以及基于标签信息的 oracle 诊断工具,用于分析层的灵敏度。在多个基准测试中,TAQ 在大多数设置下均优于任务无关的基线方法,尤其在准确率-存储比方面取得显著提升。我们进一步通过硬件吞吐量和延迟测量验证,这些收益可转化为实际部署行为,并分析校准的鲁棒性和残差流误差传播。总体而言,TAQ 将混合精度PTQ从模型中心的压缩步骤转化为任务条件的精度分配问题。参考实现已发布于 https://anonymous.4open.science/r/TAQ-9217/README.md。

关键词

引用

@article{arxiv.2511.06516,
  title  = {You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations},
  author = {Amit LeVi and Raz Lapid and Rom Himelstein and Chaim Baskin and Ravid Shwartz Ziv and Avi Mendelson},
  journal= {arXiv preprint arXiv:2511.06516},
  year   = {2026}
}