长篇生成幻觉实体的实时检测
计算与语言
2026-02-06 v2 人工智能
机器学习
摘要
大语言模型如今在高风险应用中被广泛使用,其中幻觉可能造成严重伤害,如医疗咨询或法律建议。然而,现有的幻觉检测方法在实际应用中往往不可行,因为它们要么仅限于短期事实查询,要么需要昂贵的外部验证。我们提出了一种低成本、可扩展的方法,用于实时识别长篇生成文本中的幻觉标记,能够有效扩展至70B参数模型。我们的方案针对实体级幻觉——例如虚构的姓名、日期、引用——进行检测,而非主张级,从而自然映射到标记级标签,实现流式检测。我们开发了一种注释方法,利用网络搜索为模型响应添加 grounding 标签,以指示哪些标记对应于虚构实体。该数据集使我们能够使用简单高效的方法(如线性探针)训练有效的幻觉分类器。在四个模型家族上进行评估,我们的分类器在长篇响应方面 consistently 超过基线,包括更昂贵的方法如语义熵(例如Llama-3.3-70B模型上AUC为0.90 vs 0.71),在短篇问答设置中也具有改进。尽管仅针对实体级幻觉进行训练,但我们的探针在数学推理任务中有效检测不正确答案,表明其对实体之外的任务也具备良好的泛化能力。尽管注释方法成本较高,但我们发现来自一个模型的已注释响应可用于训练其他模型上的有效分类器;因此,我们公开发布数据集以促进复用。总体而言,我们的工作表明了一种可行的、面向实际应用的可扩展幻觉检测新方法。
引用
@article{arxiv.2509.03531,
title = {Real-Time Detection of Hallucinated Entities in Long-Form Generation},
author = {Oscar Obeso and Andy Arditi and Javier Ferrando and Joshua Freeman and Cameron Holmes and Neel Nanda},
journal= {arXiv preprint arXiv:2509.03531},
year = {2026}
}