中文

一种新颖的差分特征学习用于有效的幻觉检测与分类

计算与语言 2025-09-29 v1 人工智能

摘要

大型语言模型幻觉是一种关键挑战,其输出因训练数据中的分布偏差而偏离事实准确性。虽然近期研究表明特定隐藏层在幻觉内容和事实内容之间存在差异,但幻觉信号在层内的精确局部化仍不清晰,这限制了高效检测方法的开发。我们提出了一种双模型架构,集成Projected Fusion (PF)模块用于自适应跨层特征加权,以及Differential Feature Learning (DFL)机制,通过计算并行编码器从相同输入学习互补表示之间的差异来识别判别性特征。通过在HaluEval的问答、对话和摘要数据集上的系统性实验,我们展示了幻觉信号集中于高度稀疏的特征子集,在问答和对话任务上实现了显著的准确率提升。值得注意的是,我们的分析揭示了一种层级性的“漏斗模式”,其中浅层 exhibits 高特征多样性,而深层则表现为集中使用,从而使仅使用1%的特征维度即可维持检测性能。这些发现表明,幻觉信号的集中程度比此前假设的要大大增加,为开发可计算效率的检测系统提供了可能,从而可以在保持准确性的同时降低推理成本。

关键词

引用

@article{arxiv.2509.21357,
  title  = {A Novel Differential Feature Learning for Effective Hallucination Detection and Classification},
  author = {Wenkai Wang and Vincent Lee and Yizhen Zheng},
  journal= {arXiv preprint arXiv:2509.21357},
  year   = {2025}
}

备注

10 pages, 7 figures, 13 tables