中文

面向3D视觉 grounding 的统一表示空间

计算机视觉与模式识别 2025-06-18 v1

摘要

3D视觉 grounding (3DVG) 是场景理解中的关键任务,旨在基于文本描述识别3D场景中的物体。然而,现有方法依赖于分别预训练的视觉和文本编码器,导致在空间几何和语义类别方面存在显著差距。这种差异常导致物体定位和分类错误。该文提出UniSpace-3D,创新性地引入3DVG的统一表示空间,有效弥合视觉与文本特征之间的差距。具体而言,UniSpace-3D包含三项创新设计:i) 统一表示编码器,利用预训练的CLIP模型将视觉和文本特征映射到统一表示空间,从而有效弥合两种模态的差距;ii) 多模态对比学习模块进一步缩小模态差距;iii) 语言引导的查询选择模块利用位置和语义信息识别与文本描述对齐的物体候选点。大量实验表明,UniSpace-3D 在 ScanRefer 和 Nr3D/Sr3D 数据集上比基线模型至少提升2.24%。该代码将在论文接受后公开。

关键词

引用

@article{arxiv.2506.14238,
  title  = {Unified Representation Space for 3D Visual Grounding},
  author = {Yinuo Zheng and Lipeng Gu and Honghua Chen and Liangliang Nan and Mingqiang Wei},
  journal= {arXiv preprint arXiv:2506.14238},
  year   = {2025}
}