Q-ROAR:面向量化长上下文LLM的基于异常值的RoPE位置插值重缩放
机器学习
2025-09-19 v1 人工智能
摘要
扩展LLM上下文窗口对于长范围任务至关重要。RoPE-based position interpolation(PI)方法如线性和频率感知缩放可在无需重新训练的情况下扩展输入长度,而后训练量化(PTQ)则使实际部署成为可能。我们展示了将PI与PTQ组合会因长上下文别名、动态范围膨胀、轴网异质性和异常值偏移等耦合效应导致精度下降。我们提供了PI加PTQ的首次系统性分析,并引入两种诊断工具:插值压力(per-band phase scaling sensitivity)和尾部通胀比率(outlier shift from short to long contexts)。为此,我们提出Q-ROAR,一种面向RoPE的、仅使用权重的稳定方法,将RoPE维度分为少数几个频率带,并对W_Q、W_K进行小规模搜索,以获得per-band scales,另可选用对称变体以保持logit尺度。诊断引导的搜索使用小型长上下文开发集,无需微调、内核或架构更改。实验上,Q-ROAR在标准任务上恢复最高0.7%的精度,并将GovReport perplexity降低超过10%,同时保持短上下文性能和与现有推理堆栈的兼容性。
引用
@article{arxiv.2509.14391,
title = {Q-ROAR: Outlier-Aware Rescaling for RoPE Position Interpolation in Quantized Long-Context LLMs},
author = {Ye Qiao and Sitao Huang},
journal= {arXiv preprint arXiv:2509.14391},
year = {2025}
}