中文

基于视觉-语言辅助伪标签的弱监督3D场景图生成

计算机视觉与模式识别 2024-04-04 v1

摘要

学习以结构化且丰富的方式构建3D场景图对于现实世界的感知至关重要。然而,之前的3D场景图生成方法采用完全监督的方式,要求大量的对象和关系的实体级标注数据,这在资源上极其昂贵且繁琐。为解决这一问题,我们提出了3D-VLAP(3D视觉-语言辅助伪标签),一种通过视觉-语言辅助伪标签生成的弱监督3D场景图生成方法。具体而言,我们的3D-VLAP利用当前大规模视觉-语言模型在文本与2D图像语义对齐方面的优势,以及2D图像与3D点云之间天然存在的对应关系,从而在隐式地构建文本与3D点云之间的对应关系。首先,我们通过相机内参和外参建立3D点云到2D图像的位置对应关系,从而实现3D点云与2D图像的对齐。随后,采用大规模跨模态视觉-语言模型,通过匹配2D图像与对象类别标签来间接对齐3D实例与文本对象类别标签。最后,通过计算视觉嵌入与文本对象类别嵌入之间的相似度,分别为对象和关系生成伪标签,用于3D-VLAP模型训练。最终,我们设计了一种基于边缘自注意力的图神经网络来生成3D点云场景的场景图。广泛的实验表明,我们的3D-VLAP在实现与当前先进完全监督方法相当效果的同时,显著减轻了数据标注的负担。

关键词

引用

@article{arxiv.2404.02527,
  title  = {Weakly-Supervised 3D Scene Graph Generation via Visual-Linguistic Assisted Pseudo-labeling},
  author = {Xu Wang and Yifan Li and Qiudan Zhang and Wenhui Wu and Mark Junjie Li and Jianmin Jinag},
  journal= {arXiv preprint arXiv:2404.02527},
  year   = {2024}
}

备注

11 pages, 9 figures