中文

推理模型顽固:诊断推理模型中的指令覆盖现象

人工智能 2025-05-26 v1

摘要

大型语言模型在长期复杂推理任务中展现出惊人的能力,但经常表现出对熟悉推理模式的依赖,这一现象我们称为"推理僵化"。尽管用户提供了明确的指令,这些模型仍常常覆盖明确声明的条件,偏离惯用的推理轨迹,导致错误结论。这种行为在数学和逻辑谜题等领域尤为挑战性,因为这些领域对严格遵守指定约束至关重要。为系统性地调查推理僵化这一在先前研究中鲜有探讨的行为,我们引入了一个经专家精选的诊断数据集。该数据集包括对现有数学基准(AIME和MATH500)的特殊修改版本,以及被刻意重新设计以要求偏离熟悉推理策略的著名谜题。使用该数据集,我们识别出当模型默认遵循内在推理时发生的持续性污染模式。具体将其分为三种 distinctive 模式:(i) 解释过载,(ii) 输入不信任,和(iii) 部分指令注意,每种模式都会导致模型忽视或扭曲提供的指令。我们公开了该诊断数据集以促进未来研究在缓解语言模型推理僵化方面的工作。

关键词

引用

@article{arxiv.2505.17225,
  title  = {Reasoning Model is Stubborn: Diagnosing Instruction Overriding in Reasoning Models},
  author = {Doohyuk Jang and Yoonjeon Kim and Chanjae Park and Hyun Ryu and Eunho Yang},
  journal= {arXiv preprint arXiv:2505.17225},
  year   = {2025}
}