SECQUE:用于评估实际金融分析能力的基准
人工智能
2025-08-19 v1 计算工程、金融与科学
计算与语言
摘要
我们介绍 SECQUE, 一个用于评估大型语言模型 (LLM) 在金融分析任务中能力的全面基准测试。SECQUE 包含 565 个专家编写的题目,涵盖 SEC 公告文件分析的四个关键类别:比较分析、比率计算、风险评估和金融洞察生成。为评估模型性能,我们开发了 SECQUE-Judge,一种基于多个 LLM 判官的评估机制,其与人类评估表现出强大的一致性。此外,我们提供了对各类模型在本基准上表现的广泛分析。通过公开 SECQUE,我们旨在促进进一步的研究和金融 AI 的发展。
引用
@article{arxiv.2504.04596,
title = {SECQUE: A Benchmark for Evaluating Real-World Financial Analysis Capabilities},
author = {Noga Ben Yoash and Meni Brief and Oded Ovadia and Gil Shenderovitz and Moshik Mishaeli and Rachel Lemberg and Eitam Sheetrit},
journal= {arXiv preprint arXiv:2504.04596},
year = {2025}
}
备注
Benchmark available at: https://huggingface.co/datasets/nogabenyoash/SecQue