中文

3D CoCa:对比学习者是3D描述器

计算机视觉与模式识别 2025-04-15 v1

摘要

3D描述是指以自然语言描述3D场景内容的任务,由于点云本征稀疏以及现有方法中跨模态对齐较弱的瓶颈,仍然具有较大的挑战性。为此,我们提出3D CoCa(Contrastive Learners are 3D Captioners),这是一个新颖的统一框架,将对比式视觉语言学习与3D描述生成无缝集成于单一架构中。我们的做法利用冻结的CLIP视觉语言主干网络提供丰富的语义先验,构建空间感知的3D场景编码器以捕获几何上下文,并采用多模态解码器生成描述性标题。与依赖显式目标提议的两阶段方法不同,3D CoCa在共享特征空间中联合优化对比和描述目标,无需外部检测器或手工设计的提议。这一联合训练范式通过对齐3D与文本表示,实现更强的空间推理和更丰富的语义 grounding。广泛的在ScanRefer和Nr3D基准上的实验表明,3D CoCa在CIDEr指标上分别以10.2%和5.76%的提升显著优于当前最先进的方法。代码将在https://github.com/AIGeeksGroup/3DCoCa提供。

关键词

引用

@article{arxiv.2504.09518,
  title  = {3D CoCa: Contrastive Learners are 3D Captioners},
  author = {Ting Huang and Zeyu Zhang and Yemin Wang and Hao Tang},
  journal= {arXiv preprint arXiv:2504.09518},
  year   = {2025}
}