注意力揭示超越标记:基于注意力引导检索的无训练长上下文推理
计算与语言
2025-03-14 v1
摘要
大语言模型(LLMs)在处理需要整合长上下文多个部分信息并执行多步推理的复杂推理任务时,通常表现出比其声称容量显著更短的有效上下文长度。虽然思维链(CoT)提示在降低任务复杂性方面显示出前景,但我们的实证分析揭示它并未完全解决这一局限。通过受控实验,我们识别出对隐含事实的回忆不佳是失败的主要原因,这显著阻碍了推理性能。有趣的是,我们观察到生成的CoT标记的内部注意力权重可以有效地为隐含事实提供支撑,即使这些事实未被明确回忆。基于这一洞察,我们提出了一种新颖的无训练算法Attrieval,它利用注意力权重从长上下文中检索相关事实并将其纳入推理过程。此外,我们发现从CoT标记中选择上下文标记可以进一步提升性能。我们的结果表明,Attrieval在合成和真实QA数据集上显著增强了各种模型的长期上下文推理能力。
引用
@article{arxiv.2503.09819,
title = {Attention Reveals More Than Tokens: Training-Free Long-Context Reasoning with Attention-guided Retrieval},
author = {Yuwei Zhang and Jayanth Srinivasa and Gaowen Liu and Jingbo Shang},
journal= {arXiv preprint arXiv:2503.09819},
year = {2025}
}
备注
Work in progress