FinBen:面向大型语言模型的整体金融基准
计算与语言
2024-06-21 v2 人工智能
计算工程、金融与科学
摘要
LLM 已经改变了 NLP,并在各个领域展现出潜力,然而由于缺乏全面的评估基准、LLM 的快速发展以及金融任务的复杂性,它们在金融领域的潜力尚未得到充分探索。在本文中,我们介绍了 FinBen,这是第一个广泛的开源评估基准,包含跨越 24 项金融任务的 36 个数据集,涵盖七个关键方面:信息抽取(IE)、文本分析、问答(QA)、文本生成、风险管理、预测和决策。FinBen 提供了几项关键创新:更广泛的任务和数据集范围、首次股票交易评估、新颖的代理和检索增强生成(RAG)评估,以及三个用于文本摘要、问答和股票交易的新型开源评估数据集。我们对包括 GPT-4、ChatGPT 和最新的 Gemini 在内的 15 个代表性 LLM 的评估揭示了几个关键发现:虽然 LLM 在 IE 和文本分析方面表现出色,但它们在高级推理和文本生成与预测等复杂任务上存在困难。GPT-4 在 IE 和股票交易方面表现优异,而 Gemini 在文本生成和预测方面更佳。指令微调的 LLM 改善了文本分析,但对 QA 等复杂任务带来的收益有限。FinBen 已被用于在 IJCAI-2024 期间的 FinNLP-AgentScen 研讨会上举办首届金融 LLM 共享任务,吸引了 12 个团队。他们的新颖解决方案优于 GPT-4,展示了 FinBen 推动金融 LLM 创新的潜力。所有数据集、结果和代码均向研究社区发布:https://github.com/The-FinAI/PIXIU。
引用
@article{arxiv.2402.12659,
title = {FinBen: A Holistic Financial Benchmark for Large Language Models},
author = {Qianqian Xie and Weiguang Han and Zhengyu Chen and Ruoyu Xiang and Xiao Zhang and Yueru He and Mengxi Xiao and Dong Li and Yongfu Dai and Duanyu Feng and Yijing Xu and Haoqiang Kang and Ziyan Kuang and Chenhan Yuan and Kailai Yang and Zheheng Luo and Tianlin Zhang and Zhiwei Liu and Guojun Xiong and Zhiyang Deng and Yuechen Jiang and Zhiyuan Yao and Haohang Li and Yangyang Yu and Gang Hu and Jiajia Huang and Xiao-Yang Liu and Alejandro Lopez-Lira and Benyou Wang and Yanzhao Lai and Hao Wang and Min Peng and Sophia Ananiadou and Jimin Huang},
journal= {arXiv preprint arXiv:2402.12659},
year = {2024}
}
备注
26 pages, 11 figures