中文

干扰导致错误:语言模型在 faulty mechanisms 掩盖 sound mechanisms 时出现不平衡括号错误

计算与语言 2025-07-02 v1 人工智能 软件工程

摘要

尽管编码能力取得了显著进步,语言模型 (LM) 仍在诸如生成平衡括号等简单语法任务上存在困难。本研究探究了这些错误在不同规模 (124M-7B) 语言模型中持续存在的底层机制,以理解并缓解这些错误。我们的研究发现,语言模型依赖于多个组件 (注意力头和前馈神经元) 独立作出预测。其中一些组件在广泛的输入范围内可靠地促进正确答案 (即实现“sound mechanisms”),而另一些组件则不可靠,通过促进错误标记引入噪声 (即实现“faulty mechanisms”)。当 faulty mechanisms 掩盖 sound mechanisms 并主导预测时,就会发生错误。针对这一洞察,我们引入了 RASteer,这是一种引导方法,用于系统性地识别并增加可靠组件的贡献,以提高模型性能。RASteer 在平衡括号任务上显著提升了性能,将一些模型的准确率从 00% 提升至约 100100%,且未损害模型的通用编码能力。我们进一步展示了其在算术推理任务中的更广泛适用性,实现了约 2020% 的性能提升。

关键词

引用

@article{arxiv.2507.00322,
  title  = {Failure by Interference: Language Models Make Balanced Parentheses Errors When Faulty Mechanisms Overshadow Sound Ones},
  author = {Daking Rai and Samuel Miller and Kevin Moran and Ziyu Yao},
  journal= {arXiv preprint arXiv:2507.00322},
  year   = {2025}
}

备注

23 pages, 10 figures, Preprint