OCID-Ref:面向杂乱场景定位的具身语言三维机器人数据集
计算与语言
2021-04-15 v2 计算机视觉与模式识别
摘要
为了在工作环境中有效应用机器人并辅助人类,开发和评估视觉定位(VG)如何影响机器在遮挡物体上的性能至关重要。然而,当前的VG工作局限于办公室和仓库等工作环境,其中物体常因空间利用问题而被遮挡。在我们的工作中,我们提出了一种新颖的OCID-Ref数据集,其特点是一项针对遮挡物体指称表达式的参照表达式分割任务。OCID-Ref包含来自2300个场景的305,694条参照表达式,并提供RGB图像和点云输入。为解决具有挑战性的遮挡问题,我们认为利用2D和3D信号共同解决遮挡难题至关重要。我们的实验结果证明了聚合2D和3D信号的有效性,但指代遮挡物体对现代视觉定位系统而言仍具挑战性。OCID-Ref公开于 https://github.com/lluma/OCID-Ref
引用
@article{arxiv.2103.07679,
title = {OCID-Ref: A 3D Robotic Dataset with Embodied Language for Clutter Scene Grounding},
author = {Ke-Jyun Wang and Yun-Hsuan Liu and Hung-Ting Su and Jen-Wei Wang and Yu-Siang Wang and Winston H. Hsu and Wen-Chin Chen},
journal= {arXiv preprint arXiv:2103.07679},
year = {2021}
}
备注
NAACL 2021