FinS-Pilot:面向在线金融 RAG 系统的基准测试
计算与语言
2025-09-03 v2 人工智能
摘要
大语言模型(LLM)在各专业领域展现出了卓越的能力,其性能通常通过标准化基准进行评估。在金融领域,对专业准确性和实时数据处理的严格要求通常需要使用检索增强生成(RAG)技术。然而,受限于数据保密问题以及缺乏动态数据集成,金融 RAG 基准的开发受到制约。为解决这一问题,我们提出了 FinS-Pilot,一种用于评估在线金融应用中 RAG 系统的新型基准。该基准基于真实的金融助手交互构建,融合了实时 API 数据与文本数据,并通过涵盖关键金融领域的意图分类框架进行组织。该基准能够全面评估金融助手在处理静态知识和时效性市场信息方面的能力。通过对多个中国领先的 LLM 进行系统实验,我们证明了 FinS-Pilot 在识别适用于金融应用的模型方面的有效性,同时弥补了当前金融领域专用评估工具的空白。我们的工作提供了一个实用的评估框架和精选数据集,以推动金融 NLP 系统的研究。代码和数据集已在 GitHub 上公开。
引用
@article{arxiv.2506.02037,
title = {FinS-Pilot: A Benchmark for Online Financial RAG System},
author = {Feng Wang and Yiding Sun and Jiaxin Mao and Wei Xue and Danqing Xu},
journal= {arXiv preprint arXiv:2506.02037},
year = {2025}
}