具有未知扰动的在线逆强化学习
系统与控制
2021-07-07 v1 系统与控制
最优化与控制
摘要
本文研究在存在未知扰动且带有建模不确定性的非线性系统的在线逆强化学习问题。所提方法观测智能体的状态与输入轨迹,并在线辨识未知奖励函数。观测轨迹中由未知外部扰动引入的次优性,通过一种新颖的基于模型的逆强化学习方法来补偿。该观测器估计外部扰动,并利用所得估计来学习示范者的动态模型。习得的示范者模型与观测到的次优轨迹一起用于实现逆强化学习。利用 Lyapunov 理论给出了理论保证,并给出仿真示例以证明所提技术的有效性。
引用
@article{arxiv.2003.03912,
title = {Online inverse reinforcement learning with unknown disturbances},
author = {Ryan Self and Moad Abudia and Rushikesh Kamalapurkar},
journal= {arXiv preprint arXiv:2003.03912},
year = {2021}
}
备注
8 pages, 3 figures