中文

FACTOID:用于幻觉检测的事实蕴含

计算与语言 2024-03-29 v1 人工智能

摘要

大语言模型(LLM)的广泛应用带来了诸多益处。然而,幻觉是一个重大隐患。为此,检索增强生成(RAG)作为一种极具前景的范式出现,通过将 LLM 的输出基于事实信息来改进其生成质量。RAG 依赖于文本蕴含(TE)或类似方法,以检查 LLM 生成的文本与检索到的文档相比是得到支持还是相互矛盾。本文论证了传统的 TE 方法不足以发现 LLM 生成内容中的幻觉。例如,考虑一个关于“美国对乌克兰战争立场”的提示。AI 生成的文本陈述道:“……美国总统巴拉克·奥巴马表示,美国不会向乌克兰派兵……”然而,在战争期间美国总统是乔·拜登,这与事实相矛盾。此外,当前的 TE 系统无法准确标注给定文本并识别出相矛盾的具体部分。为解决此问题,我们引入了一种名为“事实蕴含(FE)”的新型 TE,旨在检测 LLM 生成内容中的事实不准确之处,同时高亮显示与事实相矛盾的具体文本片段。我们提出了 FACTOID(用于幻觉检测的事实蕴含),一个用于 FE 的基准数据集。我们为 FE 提出了一个多任务学习(MTL)框架,结合了最先进的(SoTA)长文本嵌入(如 e5-mistral-7b-instruct),以及 GPT-3、SpanBERT 和 RoFormer。与 SoTA TE 方法相比,所提出的用于 FE 的 MTL 架构在 FACTOID 基准上的准确率平均提高了 40%。由于 FE 能自动检测幻觉,我们评估了 15 个现代 LLM,并使用我们提出的自动幻觉脆弱性指数(HVI_auto)对其进行排名。该指数对 LLM 的幻觉进行量化,并提供了一个评估和排名 LLM 幻觉问题的比较尺度。

关键词

引用

@article{arxiv.2403.19113,
  title  = {FACTOID: FACtual enTailment fOr hallucInation Detection},
  author = {Vipula Rawte and S. M Towhidul Islam Tonmoy and Krishnav Rajbangshi and Shravani Nag and Aman Chadha and Amit P. Sheth and Amitava Das},
  journal= {arXiv preprint arXiv:2403.19113},
  year   = {2024}
}