学习停止:均值场最优停止问题的深度学习方法
最优化与控制
2025-06-10 v2 机器学习
摘要
最优停止是优化中的一个基本问题,广泛应用于风险管理、金融、机器人和机器学习领域。我们将标准框架扩展到多代理设置,称为多代理最优停止(MAOS),其中代理人合作在有限空间、离散时间环境中做出最优停止决策。由于当代理人数量很大时,求解MAOS变得计算上不可行,我们研究了作为代理人数量趋于无穷大时获得的均值场最优停止(MFOS)问题。我们证明了MFOS为MAOS提供了良好的近似,并证明了基于均值场控制理论的动态规划原理(DPP)。我们随后提出了两种深度学习方法:一种通过模拟完整轨迹来学习最优停止决策,另一种利用DPP来计算价值函数并通过反向归纳学习最优停止规则。两种方法都使用神经网络来逼近最优停止策略。我们通过数值实验演示了方法的有效性和可扩展性,其中包括最多300维空间的6个不同问题。据我们了解,这是首个在离散时间和有限空间中形式化和计算求解MFOS的工作,为可扩展的MAOS方法开辟了新的方向。
引用
@article{arxiv.2410.08850,
title = {Learning to Stop: Deep Learning for Mean Field Optimal Stopping},
author = {Lorenzo Magnino and Yuchen Zhu and Mathieu Laurière},
journal= {arXiv preprint arXiv:2410.08850},
year = {2025}
}
备注
Accepted to ICML 2025