中文

Merton 投资组合问题的 Pontryagin 引导策略优化

最优化与控制 2025-01-14 v4 数理金融

摘要

我们提出了一个用于 Merton 投资组合问题的 Pontryagin 引导直接策略优化(PG-DPO)框架,将基于现代神经网络的策略参数化与 Pontryagin 极大值原理(PMP)的伴随观点统一起来。我们没有近似价值函数(如深度 BSDE 方法所做的那样),而是跟踪伴随过程的策略固定 BSDE,这使得每次梯度更新都能与连续时间 PMP 条件对齐。这种设置产生了与经典随机控制密切相关的局部最优消费和投资策略。我们进一步引入了对齐惩罚,将学习到的策略推向 Pontryagin 导出的解,从而提高了收敛速度和训练稳定性。数值实验证实,PG-DPO 能有效处理消费和投资,在不需要大型离线数据集或无模型强化学习的情况下实现了强大的性能和可解释性。

关键词

引用

@article{arxiv.2412.13101,
  title  = {Pontryagin-Guided Policy Optimization for Merton's Portfolio Problem},
  author = {Jeonggyu Huh and Jaegi Jeon},
  journal= {arXiv preprint arXiv:2412.13101},
  year   = {2025}
}