中文

Face4RAG:基于中文的检索增强生成事实一致性评估

计算与语言 2024-07-10 v2 人工智能

摘要

传统检索增强生成(RAG)中事实不一致错误的现存问题激励了事实一致性评估(FCE)的研究。尽管已提出各种FCE方法,但这些方法是在由特定大型语言模型(LLM)生成的数据集上进行评估的。由于缺乏综合性基准,仍未探讨这些FCE方法在其他LLMs(具有不同错误分布)或甚至未见错误类型的LLMs上的表现,因为这些方法可能无法检测由其他LLMs生成的错误类型。为填补这一空白,本文提出了第一个独立于底层LLM的综合性FCE基准\emph{Face4RAG}。我们的基准由基于精心设计的事实不一致错误类型学构建的合成数据集和由六个常用LLMs构建的真实世界数据集组成,使我们能够在特定错误类型或真实世界错误分布上评估FCE方法。在提出的基准上,我们发现现有FCE方法未能检测逻辑谬误,这指的是答案与检索参考之间逻辑结构不匹配。为修复此问题,我们进一步提出了一种新方法\emph{L-Face4RAG},采用逻辑保持答案分解和事实-逻辑FCE的两种新设计。大量实验表明,L-Face4RAG在广泛的任务上显著优于先前方法,尤其是在其原始动机的RAG任务之外。我们提出的基准和方法均公开可用。

关键词

引用

@article{arxiv.2407.01080,
  title  = {Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese},
  author = {Yunqi Xu and Tianchi Cai and Jiyan Jiang and Xierui Song},
  journal= {arXiv preprint arXiv:2407.01080},
  year   = {2024}
}