中文

O2A:基于动作向量的单次观察学习

机器人学 2021-08-05 v3 机器学习

摘要

我们提出 O2A,一种从单段(单次)第三人称演示视频中学习执行机器人操作任务的新方法。据我们所知,这是首次针对单次演示实现此类学习。其核心新颖性在于预训练一个特征提取器,以创建我们称之为“动作向量”的动作感知表征。动作向量使用在通用动作数据集上作为动作分类器预训练的 3D-CNN 模型提取。将观察到的第三人称演示与机器人试执行所得动作向量之间的距离用作演示任务强化学习的奖励。我们报告了在仿真和真实机器人上的实验,其中演示与学习域之间在观察视角、相关物体属性、场景背景和操作器形态上均存在差异。O2A 在不同域偏移下优于基线方法,并与神谕(使用理想奖励函数者)性能相当。

关键词

引用

@article{arxiv.1810.07483,
  title  = {O2A: One-shot Observational learning with Action vectors},
  author = {Leo Pauly and Wisdom C. Agboh and David C. Hogg and Raul Fuentes},
  journal= {arXiv preprint arXiv:1810.07483},
  year   = {2021}
}