隐式行为克隆
机器人学
2021-09-02 v1 计算机视觉与模式识别
机器学习
摘要
我们发现,在广泛的机器人策略学习场景中,使用隐式模型进行有监督策略学习,平均而言通常优于常用的显式模型。我们针对该发现给出了大量实验,并提供了直观见解与理论论证,以区分隐式模型相较于显式模型的性质,尤其在逼近复杂、可能不连续且多值(集值)函数方面。在机器人策略学习任务中,我们展示了基于能量基模型(EBM)的隐式行为克隆策略通常优于常见的显式(均方误差或混合密度)行为克隆策略,包括在高维动作空间与视觉图像输入的任务上。我们发现,尽管未使用任何奖励信息,这些策略在 D4RL 基准套件的挑战性人类专家任务上提供了与最先进离线强化学习方法相当或更好的结果。在真实世界中,搭载隐式策略的机器人能够从人类演示中学习接触丰富任务上复杂且极为精细的行为,包括具有高组合复杂度的任务以及要求 1mm 精度的任务。
引用
@article{arxiv.2109.00137,
title = {Implicit Behavioral Cloning},
author = {Pete Florence and Corey Lynch and Andy Zeng and Oscar Ramirez and Ayzaan Wahid and Laura Downs and Adrian Wong and Johnny Lee and Igor Mordatch and Jonathan Tompson},
journal= {arXiv preprint arXiv:2109.00137},
year = {2021}
}