线性模型在物体堆操作视觉预见中的惊人有效性
机器人学
2020-06-17 v3
摘要
本文中,我们解决利用视觉反馈将小物体堆推入期望目标集合的问题。与估计由位姿参数化的系统状态的常规单物体操作流水线不同,该系统的底层物理状态难以从图像中观测。因此,我们采取直接在图像空间中推理的方法,并获取视觉测量的动力学以综合视觉反馈策略。我们提出一种使用图像空间 Lyapunov 函数的简单控制器,并使用三类不同的图像预测模型评估闭环性能:基于深度学习的图像到图像翻译模型、将每个像素视为粒子的以物体为中心模型,以及使用动作相关线性映射的切换线性系统。通过仿真与实验的结果,我们表明对于该任务,线性模型出奇地好——在与我们在相同数据量上训练的深度模型相比时,取得了更好的预测误差、下游任务性能以及对新环境的泛化能力。我们认为这些结果提供了一个有趣的示例,处于对基于视觉的操纵反馈最有用的模型谱系中,同时考虑了视觉预测的质量以及与严格控制和分析方法设计的兼容性。项目主页:https://sites.google.com/view/linear-visual-foresight/home
引用
@article{arxiv.2002.09093,
title = {The Surprising Effectiveness of Linear Models for Visual Foresight in Object Pile Manipulation},
author = {H. J. Terry Suh and Russ Tedrake},
journal= {arXiv preprint arXiv:2002.09093},
year = {2020}
}
备注
Accepted to Workshop on Algorithmic Foundations of Robotics (WAFR) 2020, Video link: https://www.youtube.com/watch?v=HfFSnsnR590