中文

推理模型是否更容易产生幻觉?

计算与语言 2025-05-30 v1 机器学习

摘要

近期发展的大型推理模型(LRMs)凭借长链式思维(CoT)推理能力在解决复杂任务中展现出强大性能。由于这些LRMs大多是通过在形式化推理任务上进行后训练开发的,它们是否能泛化推理能力以帮助减少事实寻求任务中的幻觉仍不明确且存在争议。例如,DeepSeek-R1报告称在事实寻求基准SimpleQA上性能提升,而OpenAI-o3则观察到更严重的幻觉。这种矛盾自然引出以下研究问题:推理模型是否更容易产生幻觉?本文从三个角度探讨该问题。(1)我们首先对LRMs的幻觉进行整体评估。分析表明,经历包含冷启动监督微调(SFT)和可验证奖励RL的完整后训练流程的LRMs通常会减轻其幻觉。相反,仅靠蒸馏以及不带冷启动微调的RL训练会引入更多微妙的幻觉。(2)为探究为何不同的后训练流程会改变对LRMs幻觉的影响,我们进行了行为分析。我们刻画了直接影响LRM事实性的两种关键认知行为:缺陷重复(Flaw Repetition),即表层推理尝试反复遵循相同的潜在错误逻辑;以及思考-回答不匹配(Think-Answer Mismatch),即最终答案未能忠实地匹配先前的CoT过程。(3)进一步地,我们从模型不确定性的角度研究了LRMs幻觉背后的机制。我们发现LRMs幻觉的增加通常与模型不确定性和事实准确性之间的错配有关。我们的工作为理解LRMs中的幻觉提供了初步认识。

关键词

引用

@article{arxiv.2505.23646,
  title  = {Are Reasoning Models More Prone to Hallucination?},
  author = {Zijun Yao and Yantao Liu and Yanxu Chen and Jianhui Chen and Junfeng Fang and Lei Hou and Juanzi Li and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2505.23646},
  year   = {2025}
}