中文

“知之为知之,不知为不知”:用于鲁棒检索增强生成的多语言相关性评估数据集

计算与语言 2024-11-12 v3 信息检索

摘要

检索增强生成(RAG)通过利用外部知识源来锚定大型语言模型(LLM)的输出,从而减少事实性幻觉。然而,先前的工作缺乏对不同语系的全面评估,使得难以评估 LLM 针对外部检索知识错误的鲁棒性。为此,我们建立了 NoMIRACL,这是一个用于评估 18 种类型学多样化语言中 RAG 场景下 LLM 鲁棒性的人工标注数据集。NoMIRACL 包含非相关子集和相关子集。非相关子集中的查询包含被判定为非相关的段落,而相关子集中的查询则包含至少一个被判定为相关的段落。我们使用以下指标衡量相关性评估:(i) 幻觉率,即在非相关子集中答案不存在于段落时,衡量模型产生幻觉的倾向;(ii) 错误率,即在相关子集中,衡量模型识别相关段落的不准确性。在我们的工作中,我们观察到大多数模型难以平衡这两种能力。LLAMA-2 和 Orca-2 等模型在非相关子集上的幻觉率超过 88%。Mistral 和 LLAMA-3 的幻觉较少,但在相关子集上的错误率高达 74.9%。总体而言,观察到 GPT-4 在两个子集上提供了最佳的权衡,突显了未来为提高 LLM 鲁棒性所需的工作。NoMIRACL 数据集和评估代码可在以下地址获取:https://github.com/project-miracl/nomiracl。

关键词

引用

@article{arxiv.2312.11361,
  title  = {"Knowing When You Don't Know": A Multilingual Relevance Assessment Dataset for Robust Retrieval-Augmented Generation},
  author = {Nandan Thakur and Luiz Bonifacio and Xinyu Zhang and Odunayo Ogundepo and Ehsan Kamalloo and David Alfonso-Hermelo and Xiaoguang Li and Qun Liu and Boxing Chen and Mehdi Rezagholizadeh and Jimmy Lin},
  journal= {arXiv preprint arXiv:2312.11361},
  year   = {2024}
}

备注

EMNLP 2024 (Findings)