中文

通过基于模型的逆强化学习学习时间不变奖励函数

机器人学 2021-09-15 v2 机器学习

摘要

逆强化学习是一种受从示范行为中学习通用奖励函数这一目标驱动的范式。然而,所学代价的通用性通常仅以对各种空间扰动的鲁棒性来评估,并假设以固定的执行速度部署。然而,在机器人背景下这是不切实际的,构建时间不变的解决方案至关重要。在这项工作中,我们提出了一种公式,使我们能够1)通过学习时间不变代价来改变执行时长,以及2)放宽从示范中学习的时间对齐要求。我们将方法应用于两种不同类型的代价公式,并在7自由度Kuka IIWA机械臂上执行的模拟放置和插孔任务的奖励函数学习背景下评估其性能。我们的结果表明,我们的方法能够从未对齐的示范中学习时间上不变的奖励,并且还能在空间上泛化到分布外任务。

关键词

引用

@article{arxiv.2107.03186,
  title  = {Learning Time-Invariant Reward Functions through Model-Based Inverse Reinforcement Learning},
  author = {Todor Davchev and Sarah Bechtle and Subramanian Ramamoorthy and Franziska Meier},
  journal= {arXiv preprint arXiv:2107.03186},
  year   = {2021}
}