归因引导的解码
机器学习
2026-03-18 v2
摘要
大型语言模型(LLM)遵循复杂指令并生成事实准确文本的能力对其现实世界应用至关重要。然而,标准解码方法通常无法稳健地满足这些要求,而现有的控制技术往往会降低整体输出质量。在这项工作中,我们引入了归因引导的解码(Attribution-Guided Decoding, AGD),一种基于可解释性的解码策略。AGD 不直接操纵模型激活,而是考虑一组高概率输出 token 候选,并选择对用户定义的感兴趣区域(Region of Interest, ROI)表现出最高归因的候选。该 ROI 可以灵活地定义在模型输入的不同部分或内部组件上,使 AGD 能够引导生成趋向各种期望的行为。我们在三个具有挑战性的领域展示了 AGD 的有效性。在指令遵循方面,我们表明 AGD 显著提升了依从性(例如,将 Llama 3.1 上的总体成功率从 66.0% 提升至 79.1%)。在知识密集型任务中,我们表明引导生成趋向使用内部知识组件或上下文来源,可以减少幻觉并提高闭卷和开卷设置下的事实准确性。此外,我们提出了一种自适应的、基于熵的 AGD 变体,通过仅在模型不确定时施加引导,来缓解质量退化并减少计算开销。我们的工作提出了一种多功能、更具可解释性且有效的方法,用于增强现代 LLM 的可靠性。
引用
@article{arxiv.2509.26307,
title = {Attribution-Guided Decoding},
author = {Piotr Komorowski and Elena Golimblevskaia and Reduan Achtibat and Thomas Wiegand and Sebastian Lapuschkin and Wojciech Samek},
journal= {arXiv preprint arXiv:2509.26307},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026