FinResearchBench:一种基于逻辑树的 Agent-as-a-Judge 金融研究智能体评估框架
计算与语言
2025-10-21 v3
摘要
近期,AI 智能体在智能水平上快速演进,并广泛应用于 STEM、软件开发和金融等专业研究领域。在这些 AI 智能体中,深度研究智能体是一类关键类别,因为它能够执行长周期任务并解决更高复杂度的问题。然而,目前系统且自动地研究这些研究智能体能力的评估框架和基准很少。此外,金融研究问题具有独特的复杂性和微妙性。为了填补这一空白,我们提出了 FinResearchBench,这是一种基于逻辑树的 Agent-as-a-Judge,专门针对金融研究智能体。它对金融研究领域内 7 类关键任务的智能体提供了全面且自动的评估。本工作的贡献有两方面:(1) 首个创新性的 Agent-as-a-Judge 系统,提取研究结果的逻辑树并将其作为中间信息,以呈现全面、可靠且稳健的评估;(2) 面向金融领域,涵盖了 70 个典型金融研究问题,分布于该领域内 7 种常见任务类型。
引用
@article{arxiv.2507.16248,
title = {FinResearchBench: A Logic Tree based Agent-as-a-Judge Evaluation Framework for Financial Research Agents},
author = {Rui Sun and Zuo Bai and Wentao Zhang and Yuxiang Zhang and Li Zhao and Shan Sun and Zhengwen Qiu},
journal= {arXiv preprint arXiv:2507.16248},
year = {2025}
}