中文

3D CoCa v2:具有测试时搜索的对比学习器用于可泛化的空间智能

计算机视觉与模式识别 2026-01-13 v1

摘要

空间智能是指在三维环境中感知、推理和描述物体及其关系的能力,构成了具身感知和场景理解的基础。3D描述旨在用自然语言描述3D场景;然而,由于点云的稀疏性和不规则性,以及更关键的是,现有描述器在截然不同的环境(包括室内和室外3D场景)中弱基础性和有限的分布外(OOD)泛化能力,这仍然具有挑战性。为应对这一挑战,我们提出了3D CoCa v2,一个可泛化的3D描述框架,它将对比视觉-语言学习与3D描述生成统一起来,并通过测试时搜索(TTS)进一步提高鲁棒性,而无需更新描述器参数。3D CoCa v2构建在冻结的基于CLIP的语义先验、用于几何的空间感知3D场景编码器以及通过对比和描述目标联合优化的多模态解码器之上,避免了外部检测器或手工设计的提议。在推理时,TTS生成多样的描述候选,并使用紧凑的场景摘要进行奖励引导的选择。实验表明,在ScanRefer上相比3D CoCa提升了+1.50 [email protected],在Nr3D上提升了+1.61 [email protected],在TOD3Cap上的零样本OOD评估中提升了+3.8 [email protected]。代码将在https://github.com/AIGeeksGroup/3DCoCav2发布。

关键词

引用

@article{arxiv.2601.06496,
  title  = {3D CoCa v2: Contrastive Learners with Test-Time Search for Generalizable Spatial Intelligence},
  author = {Hao Tang and Ting Huang and Zeyu Zhang},
  journal= {arXiv preprint arXiv:2601.06496},
  year   = {2026}
}