数据受限条件下的在线逆强化学习
系统与控制
2020-08-21 v1 系统与控制
摘要
本文针对具有数据受限和动态不确定性的系统,研究在线逆强化学习问题。在所提出的方法中,通过观测智能体执行任务,在线记录状态与控制轨迹,并利用一种新颖的逆强化学习方法实时估计奖励函数。同时并行进行参数估计,以帮助补偿智能体动态特性中的不确定性。通过开发数据驱动的更新律来估计最优反馈控制器,从而解决数据不足的问题。随后可查询该估计出的控制器,人为生成额外数据以驱动奖励函数估计。
引用
@article{arxiv.2008.08972,
title = {Online inverse reinforcement learning with limited data},
author = {Ryan Self and S M Nahid Mahmud and Katrine Hareland and Rushikesh Kamalapurkar},
journal= {arXiv preprint arXiv:2008.08972},
year = {2020}
}
备注
8 pages, 5 figures. arXiv admin note: text overlap with arXiv:2003.03912