中文

迷你优化:强化学习投资组合管理策略为何会亏钱

交易与市场微观结构 2025-09-17 v1 最优化与控制 概率论 投资组合管理 风险管理

摘要

迷你优化 (MO) 在投资组合管理中优于强化学习 (RL):RL 导致收益更低或为负,波动性更大,成本更大,CVaR 更重,盈利性更差,模型风险更高。我们通过 mark-to-market 会计建模 execution/liquidation 摩擦。运用 Malliavin 微积分 (Clark-Ocone/BEL),我们推导 policy 梯度和 risk shadow price,统一 HJB 和 KKT。这给出 dual gap 和收敛结果:几何 MO 与 RL 的下界。我们通过 Malliavin policy-梯度 交叉污染分析量化 RL 中的 phantom profit,并定义一种 control-affects-dynamics (CAD) 贴水,表明其 plausibly 为正。

关键词

引用

@article{arxiv.2509.12764,
  title  = {Myopic Optimality: why reinforcement learning portfolio management strategies lose money},
  author = {Yuming Ma},
  journal= {arXiv preprint arXiv:2509.12764},
  year   = {2025}
}

备注

43 pages