基于观测器的在线逆强化学习
系统与控制
2023-07-19 v3 机器学习
系统与控制
摘要
本文通过将具有二次代价函数的线性系统的逆强化学习(IRL)问题表述为状态估计问题,提出了一种输出反馈逆强化学习问题的新方法。开发了两种基于观测器的 IRL 技术,包括一种通过历史栈复用先前状态估计的新型观测器方法。在适当的激励条件下,建立了收敛性与鲁棒性的理论保证。仿真展示了所开发观测器与滤波器在含噪与无噪测量下的性能。
引用
@article{arxiv.2011.02057,
title = {Online Observer-Based Inverse Reinforcement Learning},
author = {Ryan Self and Kevin Coleman and He Bai and Rushikesh Kamalapurkar},
journal= {arXiv preprint arXiv:2011.02057},
year = {2023}
}
备注
7 pages, 3 figures