中文

从上下文去噪视角重新审视长上下文建模

计算与语言 2025-11-05 v2 人工智能

摘要

长上下文模型在处理长序列方面展现出了巨大潜力,促进了许多实际应用。LCMs 的成功归因于其能够在上下文中定位隐含的关键信息以进行进一步预测。然而,最近的研究表明,LCMs 经常容易受到上下文噪声(即无关词元)的影响,这些噪声会误导模型注意力。在本文中,我们对上下文噪声进行了细粒度分析,并提出了一种有效的度量标准——积分梯度分数,用于检测和量化上下文中的噪声信息。我们的发现表明,即使是简单地缓解检测到的上下文噪声,也能大幅提升模型对关键词元的注意力,并有利于后续预测。基于这一洞察,我们提出了上下文去噪训练,这是一种简单而有效的训练策略,可提高对关键词元的注意力,同时增强它们对模型预测的影响。在上下文窗口扩展和长上下文对齐设置下的四项任务中的大量实验证明了 CDT 的优越性。值得注意的是,使用 CDT 训练时,一个开源的 8B 模型能够实现与 GPT-4o(51.00)相当的性能(50.92)。

关键词

引用

@article{arxiv.2510.05862,
  title  = {Revisiting Long-context Modeling from Context Denoising Perspective},
  author = {Zecheng Tang and Baibei Ji and Juntao Li and Lijun Wu and Haijia Gui and Min Zhang},
  journal= {arXiv preprint arXiv:2510.05862},
  year   = {2025}
}