从知识到行动:面向 LLM 交易智能体的记忆控制基准
人工智能
2026-05-28 v1 交易与市场微观结构
摘要
评估大型语言模型(LLM)智能体在资本市场中是否能获利,常被建模为端到端交易:将智能体放入历史市场,让其交易,并衡量投资组合收益。此设置容易暴露两种评估失效。首先,长时间的回测常与前沿 LLM 的知识截止日期重叠,允许记忆中的 ticker、日期、价格和市场叙事取代投资推理。其次,原始收益是股票选择能力的噪声代理,因为正的表现可能来自市场 beta、风格暴露或有利的市场区间,而非真正的 alpha。我们引入KTD-Fin(Knowing-To-Doing Financial Benchmark),一个解决上述问题的端到端股票市场交易基准。KTD-Fin采用数据侧遮蔽协议,在提示和工具之间一致地匿名化关键标识符和日历信息,将历史市场记忆与投资决策分离。它还包含一种Barra式的业绩归因框架,将投资组合收益分解为市场、风格和股票选择 alpha 组成部分。在针对中国 CSI300指数进行的2024-2026年窗口内评估的十个前沿 LLM 智能体中,遮蔽显著改变了智能体的推理路径,促使其采用匿名化的因子驱动推理。归因分析进一步表明,在受控评估条件下的 LLM 智能体累计收益主要来自被动市场和风格暴露,仅显示有限的持续性股票选择 alpha。这些发现表明,金融 LLM 基准应评估智能体是否赚钱,以及收益来源是否反映可迁移的投资技能。我们将KTD-Fin发布为可复现的模板,用于受控评估和归因感知的 LLM 交易智能体。
引用
@article{arxiv.2605.28359,
title = {From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets},
author = {Taojie Zhu and Wentao Zhao and Rui Sun and Beidi Luan and Jiacheng Lu and Sinuo Wang and Jing Li and Daxin Jiang and Yonghong He and Zuo Bai},
journal= {arXiv preprint arXiv:2605.28359},
year = {2026}
}