中文

RAGTruth:用于开发可信检索增强语言模型的幻觉语料库

计算与语言 2024-05-20 v2

摘要

检索增强生成(RAG)已成为缓解大型语言模型(LLM)幻觉的主要技术。尽管集成了 RAG,LLM 仍可能提出与检索内容不支持或相矛盾的主张。为了在 RAG 框架下开发有效的幻觉预防策略,创建能够衡量幻觉程度的基准数据集至关重要。本文提出了 RAGTruth,这是一个专为分析标准 RAG 框架内 LLM 应用在不同领域和任务中的词级幻觉而定制的语料库。RAGTruth 包含近 18,000 条由不同 LLM 使用 RAG 自然生成的响应。这些响应经过了细致的逐案和逐词人工标注,并融入了对幻觉强度的评估。我们不仅对不同 LLM 的幻觉频率进行了基准测试,还批判性地评估了几种现有幻觉检测方法的有效性。此外,我们表明,使用像 RAGTruth 这样的高质量数据集,可以对相对较小的 LLM 进行微调,并在幻觉检测方面达到与使用 GPT-4 等最先进大型语言模型的现有基于提示的方法相当的竞争水平。

关键词

引用

@article{arxiv.2401.00396,
  title  = {RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models},
  author = {Cheng Niu and Yuanhao Wu and Juno Zhu and Siliang Xu and Kashun Shum and Randy Zhong and Juntong Song and Tong Zhang},
  journal= {arXiv preprint arXiv:2401.00396},
  year   = {2024}
}