中文

基于可迁移奖励分解的逆约束学习与泛化

机器人学 2023-12-11 v2

摘要

我们提出逆约束学习(ICL)问题,其从演示中恢复约束,以在新场景中自主复现受约束技能。然而,ICL 存在病态本质,导致从演示中推断约束不准确。为解决该问题,我们引入一种可迁移约束学习(TCL)算法,联合推断任务导向奖励与任务无关约束,从而实现所学技能的泛化。我们的方法 TCL 将总体奖励加性分解为任务奖励及其残差(作为软约束),最大化任务导向策略与约束导向策略间的策略散度,以获得可迁移约束。在三个仿真环境中评估我们的方法与五种基线,表明 TCL 优于最先进的 IRL 与 ICL 算法,在新场景中相较次优方法实现了最高达 72%72\% 更高的任务成功率且分解准确。此外,我们在两个真实世界机器人任务上展示了 TCL 的鲁棒性。

关键词

引用

@article{arxiv.2306.12357,
  title  = {Inverse Constraint Learning and Generalization by Transferable Reward Decomposition},
  author = {Jaehwi Jang and Minjae Song and Daehyung Park},
  journal= {arXiv preprint arXiv:2306.12357},
  year   = {2023}
}

备注

8 pages, 8 figures