ConDense:面向多视图图像稠密与稀疏特征的一致性 2D/3D 预训练
计算机视觉与模式识别
2024-09-02 v1
摘要
为了推动 3D 基础模型创建领域的最新进展,本文介绍了 ConDense 框架,该框架利用现有的预训练 2D 网络和大规模多视图数据集进行 3D 预训练。我们提出了一种新颖的 2D-3D 联合训练方案,在端到端流水线中提取共嵌入的 2D 和 3D 特征,其中通过类似 NeRF 的体积渲染光线步进过程来强制执行 2D-3D 特征一致性。使用逐像素稠密特征,我们能够:1) 将学习到的先验从 2D 模型直接蒸馏到 3D 模型,并创建有用的 3D 主干网络;2) 提取更一致、噪声更小的 2D 特征;3) 构建一个一致的嵌入空间,使得 2D、3D 以及其他模态的数据(如自然语言提示)可以在其中被联合查询。此外,除了稠密特征,ConDense 还可以被训练来提取稀疏特征(如关键点),同样具有 2D-3D 一致性——将 3D NeRF 表示浓缩为紧凑的装饰关键点集合。我们证明,我们的预训练模型为包括 3D 分类和分割在内的各种 3D 任务提供了良好的初始化,以显著优势优于其他 3D 预训练方法。通过利用我们的稀疏特征,它还支持了额外的有用下游任务,例如将 2D 图像匹配到 3D 场景、检测重复的 3D 场景,以及通过自然语言查询 3D 场景库——所有这些都相当高效,且无需任何逐场景微调。
引用
@article{arxiv.2408.17027,
title = {ConDense: Consistent 2D/3D Pre-training for Dense and Sparse Features from Multi-View Images},
author = {Xiaoshuai Zhang and Zhicheng Wang and Howard Zhou and Soham Ghosh and Danushen Gnanapragasam and Varun Jampani and Hao Su and Leonidas Guibas},
journal= {arXiv preprint arXiv:2408.17027},
year = {2024}
}
备注
ECCV 2024