基于对比语言-彩色点图预训练的统一 3D 场景理解
计算机视觉与模式识别
2026-04-06 v1 机器学习
摘要
通过与对比语言图像预训练(CLIP)对齐来预训练 3D 编码器已成为学习 3D 场景理解通用表征的有前景之路。本文提出 UniScene3D,一个基于变换器的编码器,从多视角彩色点图中学习统一场景表征,联合建模图像外观与几何。为实现稳健的彩色点图表征学习,我们引入新型的跨视角几何对齐和 grounding view 对齐,以强制跨视角几何和语义一致性。广泛的低样本和任务特定微调评估表明,我们在视点 grounding、场景检索、场景类型分类和 3D VQA 等任务上实现了最先进的性能。这些结果凸显了我们方法对于统一 3D 场景理解的有效性。https://yebulabula.github.io/UniScene3D/
引用
@article{arxiv.2604.02546,
title = {Contrastive Language-Colored Pointmap Pretraining for Unified 3D Scene Understanding},
author = {Ye Mao and Weixun Luo and Ranran Huang and Junpeng Jing and Krystian Mikolajczyk},
journal= {arXiv preprint arXiv:2604.02546},
year = {2026}
}
备注
24 pages