物理与背景属性如何影响机器人操作中的视频 Transformer:基于平面推动的个案研究
机器人学
2024-08-29 v4 计算机视觉与模式识别
摘要
随着机器人学习中模型与数据集规模的持续扩大,理解数据集的组成与属性如何影响模型性能变得愈发迫切,以确保具成本效益的数据收集和模型性能。本工作中,我们实证研究了物理属性(颜色、摩擦系数、形状)和场景背景特征(例如与背景物体交互的复杂性与动态性)如何影响 Video Transformer 在预测平面推动轨迹上的性能。我们探究三个主要问题:物理属性和背景场景特征如何影响模型性能?何种属性变化对模型泛化最为不利?需要多大比例的微调数据以使模型适应新场景?为推进该研究,我们提出 CloudGripper-Push-1K,一个大型真实世界基于视觉的机器人推动数据集,包含 1278 小时和 460,000 段具有不同物理与背景属性的物体平面推动交互视频。我们还提出了 Video Occlusion Transformer(VOT),一个通用的基于模块化视频 Transformer 的轨迹预测框架,其以 3 种 2D 空间编码器选择作为我们个案研究的对象。数据集与源代码可在 https://cloudgripper.org 获取。
引用
@article{arxiv.2310.02044,
title = {How Physics and Background Attributes Impact Video Transformers in Robotic Manipulation: A Case Study on Planar Pushing},
author = {Shutong Jin and Ruiyu Wang and Muhammad Zahid and Florian T. Pokorny},
journal= {arXiv preprint arXiv:2310.02044},
year = {2024}
}
备注
IEEE/RSJ IROS 2024