推理模型识别并从无益思维中恢复的能力如何?
计算与语言
2025-09-25 v2
摘要
近期的推理模型展现了反思、回溯和自我验证其推理过程的能力,这对于发现错误并得出准确解至关重要。由此产生的一个自然问题是,模型执行此类自我重评估的有效性如何。我们通过研究推理模型识别并从四种无益思维中恢复的能力来探讨这一问题:无信息的冗长思维、与问题无关的思维、将问题误导为略微不同问题的思维,以及导致错误答案的思维。我们表明,模型在识别大多数无益思维方面是有效的,但当这些思维被注入其思考过程后,模型却难以从中恢复,导致显著的性能下降。模型倾向于天真地延续注入的无关思维的推理路线,这表明它们的自我重评估能力远未达到普遍的“元认知”意识。此外,我们观察到非/逆缩放趋势,即较大的模型在从简短无关思维中恢复时比较小模型更困难,即使被指示重新评估其推理也是如此。我们通过使用无关思维注入的越狱实验展示了这些发现的影响,表明最小的模型最不容易被触发有害响应的思维所干扰。总体而言,我们的发现呼吁改进推理模型的自我重评估,以开发更优的推理和更安全的系统。
引用
@article{arxiv.2506.10979,
title = {How Well Can Reasoning Models Identify and Recover from Unhelpful Thoughts?},
author = {Sohee Yang and Sang-Woo Lee and Nora Kassner and Daniela Gottesman and Sebastian Riedel and Mor Geva},
journal= {arXiv preprint arXiv:2506.10979},
year = {2025}
}
备注
Findings of EMNLP 2025