迷你优化:强化学习投资组合管理策略为何会亏钱
交易与市场微观结构
2025-09-17 v1 最优化与控制
概率论
投资组合管理
风险管理
摘要
迷你优化 (MO) 在投资组合管理中优于强化学习 (RL):RL 导致收益更低或为负,波动性更大,成本更大,CVaR 更重,盈利性更差,模型风险更高。我们通过 mark-to-market 会计建模 execution/liquidation 摩擦。运用 Malliavin 微积分 (Clark-Ocone/BEL),我们推导 policy 梯度和 risk shadow price,统一 HJB 和 KKT。这给出 dual gap 和收敛结果:几何 MO 与 RL 的下界。我们通过 Malliavin policy-梯度 交叉污染分析量化 RL 中的 phantom profit,并定义一种 control-affects-dynamics (CAD) 贴水,表明其 plausibly 为正。
关键词
引用
@article{arxiv.2509.12764,
title = {Myopic Optimality: why reinforcement learning portfolio management strategies lose money},
author = {Yuming Ma},
journal= {arXiv preprint arXiv:2509.12764},
year = {2025}
}
备注
43 pages