评估面向需时空几何推理的物体装配任务的视觉表示鲁棒性
机器人学
2024-02-08 v3 计算机视觉与模式识别
摘要
本文主要关注在物体装配任务背景下评估和基准测试视觉表示的鲁棒性。具体而言,它研究具有几何凸起与凹陷的物体的对齐与插入,通常称为销孔装配(peg-in-hole)任务。在 SE(3) 空间中成功装配所需的检测和定向销与孔几何的精度带来了显著挑战。为此,我们采用视觉运动策略学习中的通用框架,该框架使用视觉预训练模型作为视觉编码器。我们的研究考察了该框架应用于双臂操作设置时针对抓取变化的鲁棒性。我们的定量分析表明,现有预训练模型未能捕捉该任务所需的基本视觉特征。然而,从头训练的视觉编码器始终优于冻结的预训练模型。此外,我们讨论了能大幅改善策略学习的旋转表示及相应的损失函数。我们提出了一种新颖的任务场景,旨在评估视觉运动策略学习的进展,特别关注提升需要几何与空间推理的复杂装配任务的鲁棒性。视频、补充实验、数据集与代码见 https://bit.ly/geometric-peg-in-hole 。
引用
@article{arxiv.2310.09943,
title = {Evaluating Robustness of Visual Representations for Object Assembly Task Requiring Spatio-Geometrical Reasoning},
author = {Chahyon Ku and Carl Winge and Ryan Diaz and Wentao Yuan and Karthik Desingh},
journal= {arXiv preprint arXiv:2310.09943},
year = {2024}
}