安全约束下凸正则化与策略梯度流的收敛性
机器学习
2025-09-17 v2 人工智能
最优化与控制
概率论
机器学习
摘要
本文考察具有几乎必然安全约束的强化学习(RL)在无限期决策过程中的问题,这些约束对于自动驾驶、金融和资源管理等应用至关重要。我们提出一种双重正则化的 RL 框架,将奖励和参数正则化结合,以在连续状态-动作空间中处理安全约束。该问题被形式化为具有参数化策略的凸正则化目标,在均值场范式下进行建模。利用均值场理论和 Wasserstein 梯度流,策略在无限维统计流形上建模,更新由参数分布梯度流控制。关键贡献包括安全受约束问题的可解性条件、梯度流的光滑有界近似以及在充分正则化下的指数级收敛保证。包括熵正则化在内的通用正则化条件支持实际的粒子方法实现。该框架为在复杂高维环境中进行安全 RL 提供了稳健的理论见解和保证。
关键词
引用
@article{arxiv.2411.19193,
title = {Convex Regularization and Convergence of Policy Gradient Flows under Safety Constraints},
author = {Pekka Malo and Lauri Viitasaari and Antti Suominen and Eeva Vilkkumaa and Olli Tahvonen},
journal= {arXiv preprint arXiv:2411.19193},
year = {2025}
}
备注
29 pages