中文

DySCO:面向长上下文语言模型的动态注意力缩放解码

计算与语言 2026-04-17 v2

摘要

理解和推理长上下文是语言模型(LM)的关键能力。虽然最近的模型支持越来越长的上下文窗口,但其准确率常随输入长度增大而恶化。实际中,模型在解码过程中常难以维持注意力与最相关上下文的对齐。本文提出一种新型解码算法DYSCO,以提高长上下文推理性能。DYSCO利用检索头——一部分专为长上下文检索设计的注意力头——在每个解码步骤识别任务相关 token 并显式放大它们。如此,DYSCO在生成期间动态调整注意力,以更好地利用相关上下文。该方法无需训练,可直接应用于任何现成的语言模型。在多个指令调优和推理模型上,DYSCO在具有挑战性的长上下文推理基准测试中 consistently 提升性能,在128K上下文长度下,相对于基准可提高最高达25%。进一步分析突显了动态注意力缩放和检索头导向选择对该方法有效性的重要性,同时提供了解码时注意力行为的解释性见解。我们的代码可在 https://github.com/princeton-pli/DySCO 获取。

关键词

引用

@article{arxiv.2602.22175,
  title  = {DySCO: Dynamic Attention-Scaling Decoding for Long-Context Language Models},
  author = {Xi Ye and Wuwei Zhang and Fangcong Yin and Howard Yen and Danqi Chen},
  journal= {arXiv preprint arXiv:2602.22175},
  year   = {2026}
}