中文

利用推理轨迹进行幻觉检测:基于答案一致性表示塑形

机器学习 2026-05-06 v3

摘要

大规模推理模型(LRM)常生成长篇看似连贯的推理轨迹,却仍产生错误答案,导致幻觉检测困难。虽然轨迹包含有用信号,但直接使用轨迹文本或原始隐藏状态进行检测不够稳健:轨迹形式多变,检测器容易对浅层模式而非答案有效性过拟合。我们引入答案一致性表示塑形(ARS),通过显式编码答案稳定性来学习检测友好的轨迹条件表示。ARS通过对轨迹边界嵌入进行小幅潜在干扰来生成反事实答案,并标记每个干扰是否导致答案与原始答案一致。随后,ARS学习表示,使答案一致的状态聚集,而答案不一致的状态相互分离,从而暴露表明幻觉风险的潜在不稳定性。塑形后的嵌入可直接集成到现有的基于嵌入的检测器中,训练期无需人工标注。实验表明,ARS在检测上 consistently 获得显著提升,相较于强基线实现 substantial 改进。代码已公开:https://github.com/radiolab-ntu/ars_icml2026。

关键词

引用

@article{arxiv.2601.17467,
  title  = {Harnessing Reasoning Trajectories for Hallucination Detection via Answer-agreement Representation Shaping},
  author = {Jianxiong Zhang and Bing Guo and Yuming Jiang and Haobo Wang and Bo An and Sean Du},
  journal= {arXiv preprint arXiv:2601.17467},
  year   = {2026}
}

备注

ICML 2026