中文

INVESTORBENCH:基于 LLM 智能体的金融决策任务基准

计算工程、金融与科学 2024-12-25 v1 人工智能 计算金融

摘要

近期进展凸显了大语言模型(Large Language Model, LLM)驱动的智能体在金融决策中的潜力。尽管如此,该领域仍面临两个主要挑战:(1) 缺乏适用于多种金融任务的综合性 LLM 智能体框架;(2) 缺乏用于评估智能体性能的标准化基准和一致数据集。为此,我们提出了 \textsc{InvestorBench}——首个专为评估 LLM 智能体在多样化金融决策情境中表现而设计的基准。InvestorBench 通过提供适用于不同金融产品的综合任务套件,提升了 LLM 智能体的灵活性,包括单只股票、加密货币和交易型指数基金(ETF)等。我们使用十三种不同的 LLMs 作为 backbone 模型,跨越各种市场环境和任务,评估了本智能体框架的推理与决策能力。此外,我们精选了多样化的开源多模态数据集,并构建了金融决策的全面环境,建立了一个高可及平台,用于评估金融智能体在各种情境下的表现。

关键词

引用

@article{arxiv.2412.18174,
  title  = {INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent},
  author = {Haohang Li and Yupeng Cao and Yangyang Yu and Shashidhar Reddy Javaji and Zhiyang Deng and Yueru He and Yuechen Jiang and Zining Zhu and Koduvayur Subbalakshmi and Guojun Xiong and Jimin Huang and Lingfei Qian and Xueqing Peng and Qianqian Xie and Jordan W. Suchow},
  journal= {arXiv preprint arXiv:2412.18174},
  year   = {2024}
}