中文

数据受限条件下的在线逆强化学习

系统与控制 2020-08-21 v1 系统与控制

摘要

本文针对具有数据受限和动态不确定性的系统,研究在线逆强化学习问题。在所提出的方法中,通过观测智能体执行任务,在线记录状态与控制轨迹,并利用一种新颖的逆强化学习方法实时估计奖励函数。同时并行进行参数估计,以帮助补偿智能体动态特性中的不确定性。通过开发数据驱动的更新律来估计最优反馈控制器,从而解决数据不足的问题。随后可查询该估计出的控制器,人为生成额外数据以驱动奖励函数估计。

关键词

引用

@article{arxiv.2008.08972,
  title  = {Online inverse reinforcement learning with limited data},
  author = {Ryan Self and S M Nahid Mahmud and Katrine Hareland and Rushikesh Kamalapurkar},
  journal= {arXiv preprint arXiv:2008.08972},
  year   = {2020}
}

备注

8 pages, 5 figures. arXiv admin note: text overlap with arXiv:2003.03912