基于 Moreau 包络的一阶元强化学习
机器学习
2023-05-23 v1 人工智能
机器人学
系统与控制
系统与控制
最优化与控制
摘要
元强化学习(MRL)是一种有前景的框架,用于训练能够快速适应新环境和新任务的智能体。在这项工作中,我们在策略梯度公式下研究 MRL 问题,提出了一种新颖算法,该算法使用 Moreau 包络代理正则化项来联合学习一个可针对每个单独任务的环境进行调整的元策略。我们的算法称为 Moreau 包络元强化学习(MEMRL),通过学习一个元策略,利用基于梯度的优化与 Moreau 包络正则化相结合的方式高效更新策略参数,从而适应任务分布。Moreau 包络提供了策略优化问题的平滑近似,使我们能够应用标准优化技术并收敛到合适的驻点。我们对 MEMRL 算法进行了详细分析,展示了其在非凸策略梯度优化下收敛到一阶驻点的次线性收敛速率。最后,我们在多任务二维导航问题上展示了 MEMRL 的有效性。
引用
@article{arxiv.2305.12216,
title = {On First-Order Meta-Reinforcement Learning with Moreau Envelopes},
author = {Mohammad Taha Toghani and Sebastian Perez-Salazar and César A. Uribe},
journal= {arXiv preprint arXiv:2305.12216},
year = {2023}
}