GroUSE:用于评估以 grounded question answering 为评估标准的评估器基准
计算与语言
2025-01-31 v3
摘要
检索增强生成 (RAG) 已成为一种常见范例,用于将大型语言模型 (LLM) 与私有且不断更新的知识库一起使用。本 work 我们解决了在评估由 RAG 系统生成的 grounded answer 时,将 LLM 作为评判者的挑战。为了评估 judge 模型的校准能力和判别能力,我们识别了 7 种生成故障模式,并引入 GroUSE (Grounded QA Unitary Scoring of Evaluators),即 144 个单元测试的元评估基准。该基准揭示了现有的自动化 RAG 评估框架往往忽视重要的故障模式,即使使用 GPT-4 作为评判者也是如此。为了改进当前自动化 RAG 评估框架的设计,我们提出了一种新型管线,并发现虽然封闭模型在 GroUSE 上表现良好,但最先进的开源 judge 模型仍不符合我们提出的标准,尽管它们与 GPT-4 的判断高度相关。我们的发现表明,GPT-4 的相关性不足以作为 judge 模型实际性能的完整代理,必须 supplemented with针对精确故障检测的单元测试评估。我们进一步展示了在 GPT-4 的推理痕迹上对 Llama-3 进行 fine-tuning 可显著提升其评估能力,无论是提升与 GPT-4 评估的相关性,还是在 reference 情况下的校准能力,都有所提高。
引用
@article{arxiv.2409.06595,
title = {GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering},
author = {Sacha Muller and António Loison and Bilel Omrani and Gautier Viaud},
journal= {arXiv preprint arXiv:2409.06595},
year = {2025}
}
备注
Proceedings of the 31st International Conference on Computational Linguistics