DSAS:面向多文档问答的注意力优化通用插即框架
计算与语言
2025-10-15 v1
摘要
虽然大型语言模型(LLM)在诸多领域展现出巨大潜力,但在处理多文档问答(Multi-doc QA)任务时仍存在显著局限。其一是长程依赖建模——LLM 在处理长文本时难以聚焦关键信息,削弱了重要语义关联。其二是大多数 LLM 受“信息丢失于中间”问题困扰,难以处理长输入的中间内容。现有解决方案要么截断全局依赖,要么要求高成本微调,最终缺乏通用且简洁的解决方案。为此,我们提出了双阶段自适应锐化(DSAS)方案,包含两个模块:(i)情境门控加权(CGW)模块通过层级注意力跟踪和位置感知加权评估段落相关性,缓解“信息丢失于中间”问题;(ii)逆向注意力抑制(RAS)模块通过抑制关键与无关文本之间的信息交互,增强对关键段落的聚焦,从而缓解长程依赖建模的局限。值得注意的是,DSAS 作为插即式解决方案,无需修改网络结构或增加额外训练参数。广泛实验表明,DSAS 在主流 LLM(Llama、Qwen、Mistral、Deepseek)上均取得显著效果,在 Llama-3.1-8B-Instruct 和 Qwen2.5-14B-Instruct 上的 Multi-doc QA 任务 F1 分数平均提升 4.2%。消融实验确认 CGW 和 RAS 两个模块的关键贡献。此外,附录中对 DSAS 的鲁棒性和可扩展性进行了深入论述。
引用
@article{arxiv.2510.12251,
title = {DSAS: A Universal Plug-and-Play Framework for Attention Optimization in Multi-Document Question Answering},
author = {Jiakai Li and Rongzheng Wang and Yizhuo Ma and Shuang Liang and Guangchun Luo and Ke Qin},
journal= {arXiv preprint arXiv:2510.12251},
year = {2025}
}
备注
27 pages, has been accepted by NeurIPS 2025