HART:面向大语言模型的数据驱动 hallucination 归因与证据导向追踪
计算与语言
2026-03-09 v1
摘要
大语言模型(LLMs)在文本生成和知识密集型问答任务中展现出惊人的性能,但却容易生成幻觉内容,这严重削弱了其在高风险应用领域的可靠性。现有幻觉归因方法基于外部知识检索或内部模型机制,主要聚焦于语义相似性匹配或表示层面的判别,难以在幻觉类型、底层错误生成机制与外部客观证据之间建立结构化的对齐,从而限制了幻觉片段的可解释性和证据的可追溯性。为此,我们提出 HART,一个面向大语言模型的细粒度幻觉归因与证据检索框架。HART 将幻觉追踪形式化为由四个阶段构成的结构化建模任务:片段定位、机制归因、证据检索与因果追踪。基于此,我们构建了首个针对幻觉追踪的结构化数据集,联合标注幻觉类型、错误机制及反事实证据集合,以实现因果层次的可解释性评估。实验结果表明,HART 在所提数据集上显著优于 BM25 和 DPR 等强大检索基线,验证了该追踪范式在幻觉分析与证据对齐方面的有效性与广泛适用性。
引用
@article{arxiv.2603.05828,
title = {HART: Data-Driven Hallucination Attribution and Evidence-Based Tracing for Large Language Models},
author = {Shize Liang and Hongzhi Wang},
journal= {arXiv preprint arXiv:2603.05828},
year = {2026}
}