中文

长链思维中的思维陷阱:一项可量化的研究与陷阱感知的自适应重启

人工智能 2026-01-21 v1 计算与语言

摘要

通过长链思维(Long-CoT)扩展测试时计算能显著增强推理能力,然而延长的生成过程并不保证正确性:在早期做出错误承诺后,模型可能会持续阐述一个自洽但错误的前缀。通过细粒度的轨迹分析,我们识别出思维陷阱,即一种前缀主导的死锁,其中后续的反思、替代尝试或验证均无法修正根错误。在DAPO-MATH的一个精选子集上,89%的失败案例表现出此类陷阱。为了解决这个问题,我们引入了TAAR(陷阱感知的自适应重启),这是一个测试时控制框架,它训练一个诊断策略,从部分轨迹中预测两个信号:一个用于指示截断位置的陷阱索引,以及一个用于决定是否干预及干预强度的逃逸概率。在推理时,TAAR在预测的陷阱段之前截断轨迹,并自适应地重启解码;对于严重陷入陷阱的情况,它会施加更强的扰动,包括更高温度的重采样和一个可选的结构化重启后缀。在具有挑战性的数学和科学推理基准测试(AIME24、AIME25、GPQA-Diamond、HMMT25、BRUMO25)上的实验表明,TAAR在不微调基座模型参数的情况下提升了推理性能。

关键词

引用

@article{arxiv.2601.11940,
  title  = {Thinking Traps in Long Chain-of-Thought: A Measurable Study and Trap-Aware Adaptive Restart},
  author = {Kang Chen and Fan Yu and Junjie Nian and Shihan Zhao and Zhuoka Feng and Zijun Yao and Heng Wang and Minshen Yu and Yixin Cao},
  journal= {arXiv preprint arXiv:2601.11940},
  year   = {2026}
}