中文

HuDEx:集成幻觉检测与可解释性以提升 LLM 回应可靠性

计算与语言 2025-02-13 v1 人工智能

摘要

近年来大型语言模型 (LLM) 在自然语言处理领域展现出显著进步,常常超越现有方法在广泛下游任务上取得好成绩。然而,这些模型仍面临诸多挑战,可能阻碍其实际应用。例如,幻觉现象会损害 LLM 的可靠性,尤其在需高事实精确度的领域尤为突出。当前基准主要聚焦于幻觉检测与事实性评估,却未超越识别层面。本文提出一种称为 HuDEx 的解释增强型幻觉检测模型,旨在通过检测幻觉并提供详细解释来提升 LLM 生成回应的可靠性。该模型提供了一种新颖方法,将检测与解释集成,使用户与 LLM 本身均能理解并减少错误。我们的测量结果表明,该模型在幻觉检测准确率上超越了如 Llama3 70B 与 GPT-4 等较大规模的 LLM,同时保持可靠的解释质量。此外,该模型在零样本及其他测试环境中表现良好,展示了其在多样化基准数据集上的适应性。该方法为幻觉检测研究引入了将可解释性与幻觉检测集成的新思路,进一步提升了评估语言模型中幻觉的性能与可靠性。

引用

@article{arxiv.2502.08109,
  title  = {HuDEx: Integrating Hallucination Detection and Explainability for Enhancing the Reliability of LLM responses},
  author = {Sujeong Lee and Hayoung Lee and Seongsoo Heo and Wonik Choi},
  journal= {arXiv preprint arXiv:2502.08109},
  year   = {2025}
}

备注

11 pages