面向机器人布料操作的基于不完美演示的目标感知生成对抗模仿学习
机器人学
2022-09-22 v1
摘要
生成对抗模仿学习(GAIL)可以在无需显式定义奖励函数的情况下从演示中学习策略。GAIL有潜力以高维观测(如图像)作为输入来学习策略。通过将GAIL应用于真实机器人,或许可以获得用于洗涤、叠衣服、烹饪和清洁等日常活动的机器人策略。然而,由于失误,人类演示数据往往是不完美的,这会降低所得策略的性能。我们通过关注以下特征来解决此问题:1)许多机器人任务是目标到达任务;2)在演示数据中标注此类目标状态相对容易。鉴于此,本文提出目标感知生成对抗模仿学习(GA-GAIL),其通过引入第二个判别器来与指示演示数据的第一个判别器并行区分目标状态,从而训练策略。这扩展了标准GAIL框架,通过促进达成目标状态的目标状态判别器,即使从不完美演示中也能更鲁棒地学习期望策略。此外,GA-GAIL采用熵最大化深度P网络(EDPN)作为生成器,在策略更新中同时考虑平滑性和因果熵,以从两个判别器实现稳定的策略学习。我们提出的方法成功应用于两项真实机器人布料操作任务:翻手帕和叠衣服。我们确认其在无需任务特定奖励函数设计的情况下学习了布料操作策略。真实实验视频可在 https://youtu.be/h_nII2ooUrE 获取。
引用
@article{arxiv.2209.10149,
title = {Goal-Aware Generative Adversarial Imitation Learning from Imperfect Demonstration for Robotic Cloth Manipulation},
author = {Yoshihisa Tsurumine and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2209.10149},
year = {2022}
}
备注
Accepted by Robotics and Autonomous Systems