通过强化学习中的奖励塑形保证控制需求
系统与控制
2024-03-21 v2 机器学习
系统与控制
摘要
在通过强化学习解决调节与跟踪等控制问题时,通常需要在部署前保证所获策略满足诸如期望稳定时间与稳态误差等基本性能与稳定性准则。受此必要性驱动,我们提出一组结果及系统化的奖励塑形(reward shaping)流程,其(i)确保最优策略生成符合指定控制需求的轨迹,且(ii)允许评估任意给定策略是否满足这些需求。我们通过在 OpenAI Gym 的两个代表性环境——倒立摆起摆(Inverted Pendulum swing-up)问题与月球着陆器(Lunar Lander)——中开展全面数值实验来验证我们的方法。利用表格型与深度强化学习方法,我们的实验一致肯定了所提框架的有效性,凸显其在确保策略遵从规定控制需求方面的效用。
引用
@article{arxiv.2311.10026,
title = {Guaranteeing Control Requirements via Reward Shaping in Reinforcement Learning},
author = {Francesco De Lellis and Marco Coraggio and Giovanni Russo and Mirco Musolesi and Mario di Bernardo},
journal= {arXiv preprint arXiv:2311.10026},
year = {2024}
}