梯度引导注意力图编辑:迈向高效的上下文幻觉缓解
计算与语言
2025-07-08 v2 机器学习
摘要
在摘要和开放书问答 (QA) 等任务中,大型语言模型 (LLM) 经常遭遇“上下文幻觉”,即尽管能够获取准确的源信息,它们仍会产生不相关或错误的回复。这通常是因为这些模型倾向于优先考虑自生成的内容而非输入上下文,导致其忽略相关细节。为了应对这一挑战,我们引入了一种名为“引导注意力图编辑” (GAME) 的新方法,该方法动态调整注意力图以提高上下文相关性。在推理过程中,GAME 采用一个训练好的分类器来识别容易引发幻觉的注意力图,并执行针对性干预。这些干预在梯度信息化的“编辑方向”引导下,策略性地重新分配各个头部的注意力权重,以有效减少幻觉。在具有挑战性的摘要和开放书 QA 任务上的综合评估表明,GAME 能够在多种开源模型中持续减少幻觉。具体而言,GAME 在 XSum 摘要任务中将幻觉减少了 10%,同时与 SOTA 基线相比,计算效率实现了 7 倍的加速。
引用
@article{arxiv.2503.08963,
title = {Gradient-guided Attention Map Editing: Towards Efficient Contextual Hallucination Mitigation},
author = {Yu Wang and Kamalika Das and Xiang Gao and Wendi Cui and Peng Li and Jiaxin Zhang},
journal= {arXiv preprint arXiv:2503.08963},
year = {2025}
}
备注
Accepted as Finding of NAACL 2025