中文

强化学习交易环境的真实市场冲击建模

机器学习 2026-04-07 v2 计算工程、金融与科学

摘要

强化学习(RL)在交易领域显示出前景,但大多数开源回测环境假设交易成本可忽略或固定,导致智能体学习的交易行为在真实执行环境下失效。我们引入三个兼容 Gymnasium 的交易环境——MACE(Market-Adjusted Cost Execution)股票交易、保证金交易和组合优化——这些环境整合了基于 Almgren-Chriss 框架和经实证验证的平方根冲击律的非线性市场冲击模型。每个环境提供可插拔成本模型、带指数衰减的永久性冲击跟踪以及全面的逐笔交易日志。我们在 NASDAQ-100 上评估了五个 DRL 算法(A2C、PPO、DDPG、SAC、TD3),将固定 10 bps 基准与带有 Optuna 调优超参数的 AC 模型进行比较。我们的结果表明:(i)成本模型在所有三个环境中都会显著影响绝对绩效以及相对算法排名;(ii)AC 模型会产生截然不同的交易行为,例如日均成本从 200k降至200k 降至 8k,周转率从 19\% 降至 1\%;(iii)超参数优化对于约束病态交易至关重要,成本降低最高可达 82\%;(iv)算法-成本模型之间的相互作用strongly environment-specific,例如 DDPG 在保证金交易中 OOS Sharpe 从 -2.1 提升至 0.3,而 SAC 的 Sharpe 从 -0.5 降至 -1.2。我们将完整套件作为开源扩展发布于 FinRL-Meta。

关键词

引用

@article{arxiv.2603.29086,
  title  = {Realistic Market Impact Modeling for Reinforcement Learning Trading Environments},
  author = {Lucas Riera Abbade and Anna Helena Reali Costa},
  journal= {arXiv preprint arXiv:2603.29086},
  year   = {2026}
}