中文

通过动态拒绝激活引导提升LLM指令遵循能力

机器学习 2026-03-10 v1 人工智能

摘要

尽管经过指令调优,大型语言模型(LLM)在指令遵循方面仍常常失败。激活引导技术旨在通过操控模型内部来缓解此问题,但可能导致过度引导,即对指令的过度强调会损害任务准确性和整体文本质量。为此,我们引入了DIRECTER(动态拒绝引导),一种新颖的引导方法,通过缩放KV缓存动态调节引导强度,而无需额外数据集。DIRECTER将引导与一个以可行性为导向的解码循环耦合,在每个步骤通过比较驾驭后输出分布与原始输出分布来自适应调整引导强度。如果认为驾驭后的输出不可靠,引导强度将逐渐减弱。这种强度调制由轻量级、一次性注意力灵敏度分析指导,该分析按其对模型表示影响排序图层。广泛的评估显示,DIRECTER显著提升了指令遵循能力,跨越多样化基准,准确率提升最高可达6.5%,且在生成质量或任务忠诚度之间不存在常见的权衡。该方法在激活引导期间的动态、可行性导向控制进一步表明其作为一种通用机制以缓解过度引导的潜力,与现有基线方法兼容。

关键词

引用

@article{arxiv.2603.06745,
  title  = {Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection},
  author = {Minjae Kang and Jaehyung Kim},
  journal= {arXiv preprint arXiv:2603.06745},
  year   = {2026}
}

备注

Accepted at ICLR 2026