中文

先学看再学做:面向操作的视觉预训练

机器人学 2021-07-02 v1 计算机视觉与模式识别

摘要

具备视觉先验(如检测物体的能力)是否有助于学习执行基于视觉的操作(如拾取物体)?我们在迁移学习框架下研究此问题,模型先在被动视觉任务上训练,再适配以执行主动操作任务。我们发现,在视觉任务上的预训练显著提升了操作物体学习的泛化能力与样本效率。然而,要实现这些收益需谨慎选择迁移模型的哪些部分。我们的核心洞见是,标准视觉模型的输出与操作中常用的可供性图高度相关。因此,我们探索直接将视觉网络参数迁移至可供性预测网络,并展示这可实现成功的零样本适配,即机器人能以零机器人经验拾取特定物体。仅需少量机器人经验,我们便可进一步微调可供性模型以获得更好结果。凭借仅10分钟吸盘经验或1小时抓取经验,我们的方法在新物体拾取上达到约80%成功率。

关键词

引用

@article{arxiv.2107.00646,
  title  = {Learning to See before Learning to Act: Visual Pre-training for Manipulation},
  author = {Lin Yen-Chen and Andy Zeng and Shuran Song and Phillip Isola and Tsung-Yi Lin},
  journal= {arXiv preprint arXiv:2107.00646},
  year   = {2021}
}

备注

Accepted to ICRA 2020. Porject page: http://yenchenlin.me/vision2action/