时间旅行是作弊:DeepFund 实时基金投资基准工具
计算工程、金融与科学
2025-10-15 v2 人工智能
多智能体系统
摘要
大语言模型(LLM)在金融任务中展现出显著能力,包括财报摘要、财报会议记录分析和资产分类。然而,其在复杂基金投资中的实际效果尚未得到充分评估。现有评估LLM驱动交易策略的基准方法依赖历史回测,潜在使LLM“时间旅行”——利用其训练语料库中嵌入的未来信息,从而导致信息泄露和过度乐观的绩效估计。为解决此问题,我们提出DeepFund,一个面向实时市场条件的基金基准工具,旨在严格评估LLM的实际表现。DeepFund采用多智能体架构,直接连接实时股票市场数据——具体而言是每个模型预训练截止日期之后发布的数据——以确保公平且无信息泄露的评估。对九个顶级机构的旗舰LLM进行经实证测试,涵盖 ticker 级别分析、投资决策、投资组合管理和风险控制等多个投资维度。值得注意的是,即使是DeepSeek-V3和Claude-3.7-Sonnet等最前沿的模型,在DeepFund实时评估环境中也会出现净亏损,这凸显了LLM在主动基金管理方面的当前局限性。我们的代码已公开。
引用
@article{arxiv.2505.11065,
title = {Time Travel is Cheating: Going Live with DeepFund for Real-Time Fund Investment Benchmarking},
author = {Changlun Li and Yao Shi and Chen Wang and Qiqi Duan and Runke Ruan and Weijie Huang and Haonan Long and Lijun Huang and Nan Tang and Yuyu Luo},
journal= {arXiv preprint arXiv:2505.11065},
year = {2025}
}
备注
NeurIPS 2025 Datasets and Benchmarks Track