通过原则性增强注意力实现大语言模型的指令遵循
计算与语言
2026-03-27 v3 人工智能
机器学习
摘要
大语言模型的行为通常由系统提示、拒绝边界、隐私约束和工具使用规则等指令所塑造,这些指令在推理时必须得到遵守。然而在实践中,这些约束在长上下文或用户提供的上下文与之冲突时可能被违反,从而产生可靠性和安全风险。这推动了无需重新训练的推理时干预方法。其中一种干预是注意力引导,它使注意力偏向指令标记。在这项工作中,我们通过将指令遵循形式化为指令规则与上下文衍生规则之间的基于规则的竞争(注意力决定哪些规则占主导),提出了注意力引导方法的统一理论。我们证明增强指令标记的注意力会倾斜这种竞争,使上下文更难覆盖指令遵循。然而,过度增强可能抑制应与指令一并纳入的任务相关上下文。在该理论指导下,我们提出了指令注意力增强(InstABoost),一种简单的干预方法,对所有层和头中的指令键注意力对数几率施加恒定加性偏差。我们在15个任务上评估了InstABoost,与提示、潜在引导和先前注意力引导方法进行了对比。InstABoost匹配或超越了所有基线,同时避免了潜在方法的流畅性崩溃和先前注意力方法的指令过度关注,实现了更强的引导质量权衡。
引用
@article{arxiv.2506.13734,
title = {Instruction Following by Principled Boosting Attention of Large Language Models},
author = {Vitoria Guardieiro and Avishree Khare and Adam Stein and Eric Wong},
journal= {arXiv preprint arXiv:2506.13734},
year = {2026}
}