OVGNet:面向开放词汇机器人抓取的统一视觉-语言框架
机器人学
2024-07-19 v1
摘要
识别和抓取新类别物体是实际机器人应用中至关重要且具有挑战性的任务。尽管此任务意义重大,但目前在该特定领域的研究仍有限。为此,我们提出一种新框架,将开放词汇学习无缝集成到机器人抓取领域,使机器人能够灵活处理新类别物体。我们的贡献主要包括三方面:首先,我们构建了一个专为评估开放词汇抓取任务性能而设计的大规模基准数据集;其次,我们提出一种统一的视觉-语言框架,指导机器人成功抓取基本物体和新类别物体;最后,我们引入两个对齐模块,以增强机器人抓取过程中视觉-语言感知。广泛的实验结果表明,我们的方法具有有效性和实用性。值得注意的是,在我们新构建的数据集上,该框架在基本类别和新类别上的平均准确率分别为 71.2% 和 64.4%。
引用
@article{arxiv.2407.13175,
title = {OVGNet: A Unified Visual-Linguistic Framework for Open-Vocabulary Robotic Grasping},
author = {Li Meng and Zhao Qi and Lyu Shuchang and Wang Chunlei and Ma Yujing and Cheng Guangliang and Yang Chenguang},
journal= {arXiv preprint arXiv:2407.13175},
year = {2024}
}
备注
Accepted in IROS2024