打破维度障碍:基于 Pontryagin 引导的连续时间多资产投资组合选择直接策略优化
概率论
2025-04-16 v1 动力系统
摘要
我们提出了 Pontryagin 引导的直接策略优化(PG-DPO)框架,用于高维连续时间投资组合选择。该方法将 Pontryagin 最大化原理(PMP)与通过时间反向传播(BPTT)相结合,直接指导神经网络基于策略的学习,实现对我的opic 和 intertemporal 套期保值需求的精确恢复——这一点是现有方法常忽略的。基于此,我们发展了投影 PG-DPO(P-PGDPO)变体,实现接近最优的政策,同时显著提高了效率。P-PGDPO 利用 BPTT 中快速稳定的成本估计,并对其进行分析投影到 PMP 的一阶条件,从而减少训练开销并提高精度。数值实验表明,PG-DPO 在准确性上与 Deep BSDE 持平或更好,而 P-PGDPO 在精度和可扩展性方面显著优于后者。通过显式包含到期时间,本框架自然适用于有限时限问题,捕捉时限依赖效应,其中长时限情况则作为平稳特例出现。
引用
@article{arxiv.2504.11115,
title = {Transient random walks on the space of lattices},
author = {Axel Péneau and Cagri Sert},
journal= {arXiv preprint arXiv:2504.11115},
year = {2025}
}
备注
14 pages