中文

逆强化学习的差分动态程序框架

机器人学 2024-07-30 v1 系统与控制 系统与控制 最优化与控制

摘要

介绍一种基于差分动态程序(DDP)的逆强化学习(IRL)框架,用于从演示中恢复代价函数中的参数、系统动力学以及约束条件。与现有工作不同,现有工作将 DDP 用于带不等式约束的内部前向问题中,而我们提出的框架将其用于高效计算外部逆问题所需梯度的计算,后者包含等式和不等式约束。我们建立了该方法与基于庞特迈克森最大化原理(PMP)的现有方法之间的等效性。更重要的是,使用基于 DDP 的 IRL 及其开环损失函数,提出了一个闭环 IRL 框架。在该框架中,提出了一个损失函数以捕捉演示的闭环本质。我们证明该闭环 IRL 框架优于常用的开环损失函数。我们指出,闭环 IRL 框架在特定假设下可简化为受约束的逆最优控制问题。在这些假设条件下以及满足秩条件的情况下,证明了从演示数据中可恢复学习参数。该框架通过四个数值机器人示例和一个真实世界的四旋翼机系统进行了广泛评估。实验验证了理论结果并说明了该方法的实际相关性。

关键词

引用

@article{arxiv.2407.19902,
  title  = {A Differential Dynamic Programming Framework for Inverse Reinforcement Learning},
  author = {Kun Cao and Xinhang Xu and Wanxin Jin and Karl H. Johansson and Lihua Xie},
  journal= {arXiv preprint arXiv:2407.19902},
  year   = {2024}
}

备注

20 pages, 15 figures; submitted to IEEE for potential publication