中文

是过程还是结果?操纵结束标记会误导推理 LLM 忽略正确的推理步骤

人工智能 2025-04-02 v2

摘要

近期推理大型语言模型 (LLM) 已通过长链式思维展现出在数学推理方面的显著提升。这些模型的推理标记使其在推理链内部实现自我纠正,提高了鲁棒性。这激励我们探索:推理 LLM 在输入推理链中面对细微错误时有多么脆弱。我们引入“破坏性思维”(Compromising Thought, CPT),当模型呈现包含被操纵计算结果的推理标记时,倾向于忽略正确的推理步骤而采用错误结果。通过多种推理 LLM 的系统评估,我们设计了三种日益明确的提示方法来衡量 CPT 抗性,发现模型在识别和纠正这些操纵方面存在显著困难。值得注意的是,与既有研究表明结构性变更比内容修改对模型性能影响更大不同,我们发现局部结束标记的操纵对推理结果的影响大于结构性变更。此外,我们发现 DeepSeek-R1 中的一个安全漏洞:被篡改的推理标记可触发完全停止推理。我们的工作增进了对推理鲁棒性的理解,并凸显了面向推理密集型应用的安全考量。

关键词

引用

@article{arxiv.2503.19326,
  title  = {Process or Result? Manipulated Ending Tokens Can Mislead Reasoning LLMs to Ignore the Correct Reasoning Steps},
  author = {Yu Cui and Bryan Hooi and Yujun Cai and Yiwei Wang},
  journal= {arXiv preprint arXiv:2503.19326},
  year   = {2025}
}