OmniEval:金融领域的全方位自动 RAG 评测基准
计算与语言
2025-02-18 v2
摘要
作为大语言模型(LLM)的典型且实用的应用,检索增强生成(RAG)技术受到了广泛关注,尤其是在 LLM 可能缺乏领域特定知识的垂直领域。本文介绍了金融领域的全方位自动 RAG 评测基准 OmniEval。该基准的特点在于其多维评测框架,包括:(1)基于矩阵的 RAG 场景评测系统,将查询划分为 5 个任务类别和 16 个金融主题,从而实现对多样查询场景的结构化评估;(2)多维评测数据生成方法,结合基于 GPT-4 的自动生成与人工标注,在人工评估中对生成实例达到了 87.47\% 的接受率;(3)多阶段评测系统,同时评估检索和生成性能,从而对 RAG 流程进行全面评测;(4)基于规则和基于 LLM 的鲁棒评测指标,通过人工标注和 LLM 评测器的监督微调增强了评估的可靠性。我们的实验证明了 OmniEval 的全面性,其包含广泛的测试数据集,并突显了 RAG 系统在不同主题和任务上的性能差异,揭示了 RAG 模型在垂直领域中提升能力的重大机遇。我们在 \href{https://github.com/RUC-NLPIR/OmniEval}{https://github.com/RUC-NLPIR/OmniEval} 开源了该基准的代码。
引用
@article{arxiv.2412.13018,
title = {OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain},
author = {Shuting Wang and Jiejun Tan and Zhicheng Dou and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2412.13018},
year = {2025}
}