中文

大型推理模型中幻觉的检测与缓解:一种机制学视角

人工智能 2025-05-20 v1 计算与语言 计算机与社会

摘要

大型推理模型 (LRM) 在多步骤推理任务中展现出惊人的能力。然而,随着这些成功的同时,一种更隐蔽的模型错误也浮现——推理幻觉,其中逻辑连贯但事实错误的推理轨迹导致令人信服却错误的结论。与传统幻觉不同,这些错误嵌入在结构化推理中,更难检测且可能更有害。本文从机制学视角研究推理幻觉。我们提出了推理得分 (Reasoning Score),通过衡量从 LRM 后期层投影到词汇表空间的 logits 的偏差来量化推理深度,从而有效区分浅层模式匹配与真正的深层推理。使用该得分,我们对 ReTruthQA 数据集进行深入分析,识别出两种关键的推理幻觉模式:推理深度的早期波动和对错误先前步骤的错误回溯。这些洞察激发了我们的推理幻觉检测 (RHD) 框架,该框架在多个领域实现了最先进的性能。为缓解推理幻觉,我们进一步引入了 GRPO-R,即一种增强的强化学习算法,包含通过基于潜在的 shaping 引入的步骤级别深层推理奖励。我们的理论分析提供了更强的泛化保证,实验显示推理质量得到改善,幻觉率显著降低。

关键词

引用

@article{arxiv.2505.12886,
  title  = {Detection and Mitigation of Hallucination in Large Reasoning Models: A Mechanistic Perspective},
  author = {Zhongxiang Sun and Qipeng Wang and Haoyu Wang and Xiao Zhang and Jun Xu},
  journal= {arXiv preprint arXiv:2505.12886},
  year   = {2025}
}

备注

25 pages