基于指代图像分割与几何约束的显著视觉中的机器人操作
机器人学
2024-09-19 v1 计算机视觉与模式识别
摘要
在本文中,我们通过将紧凑的指代图像分割模型集成到机器人的感知模块中,在具有语言上下文的真实世界环境中执行机器人操作活动。首先,我们提出了 CLIPUNet,一个轻量级的指代图像分割模型,专为根据语言表达进行细粒度边界和结构分割而设计。然后,我们将该模型部署在一个眼在手上视觉伺服系统中,以在真实世界中实施机器人控制。我们系统的关键是将显著视觉信息表示为几何约束,从而将机器人的视觉感知与可执行命令联系起来。在 46 个真实世界机器人操作任务上的实验结果表明,我们的方法优于依赖劳动密集型特征标注的传统视觉伺服方法,在解码器尺寸仅为 6.6 MB 的情况下实现了出色的细粒度指代图像分割,并支持跨多种上下文的机器人控制。
引用
@article{arxiv.2409.11518,
title = {Robot Manipulation in Salient Vision through Referring Image Segmentation and Geometric Constraints},
author = {Chen Jiang and Allie Luo and Martin Jagersand},
journal= {arXiv preprint arXiv:2409.11518},
year = {2024}
}