中文

OCID-Ref:面向杂乱场景定位的具身语言三维机器人数据集

计算与语言 2021-04-15 v2 计算机视觉与模式识别

摘要

为了在工作环境中有效应用机器人并辅助人类,开发和评估视觉定位(VG)如何影响机器在遮挡物体上的性能至关重要。然而,当前的VG工作局限于办公室和仓库等工作环境,其中物体常因空间利用问题而被遮挡。在我们的工作中,我们提出了一种新颖的OCID-Ref数据集,其特点是一项针对遮挡物体指称表达式的参照表达式分割任务。OCID-Ref包含来自2300个场景的305,694条参照表达式,并提供RGB图像和点云输入。为解决具有挑战性的遮挡问题,我们认为利用2D和3D信号共同解决遮挡难题至关重要。我们的实验结果证明了聚合2D和3D信号的有效性,但指代遮挡物体对现代视觉定位系统而言仍具挑战性。OCID-Ref公开于 https://github.com/lluma/OCID-Ref

关键词

引用

@article{arxiv.2103.07679,
  title  = {OCID-Ref: A 3D Robotic Dataset with Embodied Language for Clutter Scene Grounding},
  author = {Ke-Jyun Wang and Yun-Hsuan Liu and Hung-Ting Su and Jen-Wei Wang and Yu-Siang Wang and Winston H. Hsu and Wen-Chin Chen},
  journal= {arXiv preprint arXiv:2103.07679},
  year   = {2021}
}

备注

NAACL 2021