中文

检索增强生成的答案质量评估:一个强大的 LLM 就足够

计算与语言 2024-11-08 v3

摘要

我们提出了一项检索增强生成(RAG)应用中答案质量评估的全面研究,引入 vRAG-Eval 评估系统,该系统旨�衡量正确性、完整性和诚实性。我们进一步将上述质量方面的评估映射为二进制得分,表示接受或拒绝决策,类似于聊天应用中常见的“赞”或“讨厌”手势。这种方法适用于事实性商业场景,需作出明确的决策意见。我们的评估将 vRAG-Eval 应用于两个大语言模型(LLM),评估 vanilla RAG 应用程序生成的答案质量。我们将这些评估与人类专家判断进行比较,发现 GPT-4 的评估与人类专家判断在接受或拒绝决策方面达到了 83% 的一致性。这一研究突显了在封闭领域、封闭式场景中,LLM 作为可靠评估器的潜力,尤其是在需要大量人力资源进行人工评估的情形下。

关键词

引用

@article{arxiv.2406.18064,
  title  = {Evaluating Quality of Answers for Retrieval-Augmented Generation: A Strong LLM Is All You Need},
  author = {Yang Wang and Alberto Garcia Hernandez and Roman Kyslyi and Nicholas Kersting},
  journal= {arXiv preprint arXiv:2406.18064},
  year   = {2024}
}

备注

13 pages, 8 figures, 12 tables