中文

VL-SAT:视觉-语言语义辅助训练用于点云中三维语义场景图预测

计算机视觉与模式识别 2023-03-28 v1

摘要

点云中三维语义场景图(3DSSG)预测任务具有挑战性,因为(1)与二维图像相比,三维点云仅捕获具有有限语义的几何结构,且(2)长尾关系分布固有地阻碍无偏预测的学习。由于二维图像提供丰富语义且场景图本质上与语言相关联,在本研究中,我们提出视觉-语言语义辅助训练(VL-SAT)方案,可显著赋予3DSSG预测模型对长尾与歧义语义关系的判别力。其核心思想是训练一个强大的多模态预言模型来辅助三维模型。该预言基于来自视觉、语言与三维几何的语义学习可靠的结构表示,其益处可在训练阶段异质地传递给三维模型。通过有效利用训练中的视觉-语言语义,我们的VL-SAT可显著提升如SGFN与SGGpoint等常见3DSSG预测模型,在推理阶段仅使用三维输入,尤其在处理尾部关系三元组时。在3DSSG数据集上的综合评估与消融研究验证了所提方案的有效性。代码可在 https://github.com/wz7in/CVPR2023-VLSAT 获取。

关键词

引用

@article{arxiv.2303.14408,
  title  = {VL-SAT: Visual-Linguistic Semantics Assisted Training for 3D Semantic Scene Graph Prediction in Point Cloud},
  author = {Ziqin Wang and Bowen Cheng and Lichen Zhao and Dong Xu and Yang Tang and Lu Sheng},
  journal= {arXiv preprint arXiv:2303.14408},
  year   = {2023}
}

备注

CVPR2023 Highlight