AI-Trader:实时金融市场中自主代理的基准测试
计算金融
2025-12-15 v1 计算工程、金融与科学
摘要
大语言模型(LLMs)作为自主代理展示了显著潜力,通过先进的推理和工具编排接近人类专家水平。然而,在完全动态和实时环境中的决策仍然极具挑战性,需要实时信息整合和自适应响应。虽然现有工作已在结构化任务中探索了实时评估机制,但在实际应用中的系统性基准测试仍存在一个关键空白,特别是在金融领域,对实时战略响应性有严格要求。为填补这一空白,我们提出了AI-Trader,这是首个完全自动化、实时且数据未受污染的LLM代理金融决策评估基准。AI-Trader涵盖三大金融市场:美国股票、A股和加密货币,具有多种交易粒度以模拟实时金融环境。我们的基准实现了一种革命性的完全自主最小信息范式,代理仅接收基本上下文,必须独立搜索、验证和综合实时市场信息,无需人工干预。我们在三个市场和多种交易频率上评估了六种主流LLM。我们的分析揭示了引人注目的发现:通用智能不会自动转化为有效的交易能力,大多数代理表现出较差的回报和弱的风险管理能力。我们证明风险管理能力决定了跨市场鲁棒性,且AI交易策略在高度流动性市场中比政策驱动环境中更容易实现超额收益。这些发现揭示了当前自主代理的关键局限性,并为未来改进提供了明确方向。代码和评估数据已开源以促进社区研究:https://github.com/HKUDS/AI-Trader。
引用
@article{arxiv.2512.10971,
title = {AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets},
author = {Tianyu Fan and Yuhao Yang and Yangqin Jiang and Yifei Zhang and Yuxuan Chen and Chao Huang},
journal= {arXiv preprint arXiv:2512.10971},
year = {2025}
}