通过自监督奖励回归从次优演示中学习
机器人学
2020-11-24 v3 机器学习
摘要
从演示中学习(LfD)旨在通过让非机器人专家终端用户提供人类演示来教导机器人执行任务,从而推动机器人技术普及。然而,现代 LfD 技术(例如逆强化学习(IRL))假设用户提供至少随机最优的演示。该假设在大多数真实场景中不成立。近期从次优演示学习的尝试利用成对排序并遵循 Luce-Shepard 规则。但我们表明这些方法做了错误假设,因而性能脆弱且退化。我们克服了这些局限,开发了一种新方法,基于次优演示自举合成最优性参数化数据以训练理想化奖励函数。我们经实证验证学到了与真实奖励相关性约 0.95 的理想化奖励函数,而先前工作仅约 0.75。我们随后可训练出相较次优演示约 200% 提升、相较先前工作约 90% 提升的策略。我们给出了教导机器人乒乓球上旋击球的实物演示,其相较用户演示实现了回球快 32%、上旋多 40%。
引用
@article{arxiv.2010.11723,
title = {Learning from Suboptimal Demonstration via Self-Supervised Reward Regression},
author = {Letian Chen and Rohan Paleja and Matthew Gombolay},
journal= {arXiv preprint arXiv:2010.11723},
year = {2020}
}
备注
In Proceedings of the Conference on Robot Learning (CoRL '20)