PonderV2:以通用预训练范式铺就 3D 基础模型之路
计算机视觉与模式识别
2025-04-16 v4
摘要
与众多 NLP 和 2D 视觉基础模型相比,学习 3D 基础模型面临更大挑战。这主要源于固有数据可变性与下游任务多样性。本文中,我们引入一种新颖的通用 3D 预训练框架,旨在促进高效 3D 表示的获取,从而确立通往 3D 基础模型的路径。考虑到信息丰富的 3D 特征应编码可用于渲染真实图像的丰富几何与外观线索,我们提出通过可微分神经渲染学习 3D 表示。我们通过比较渲染图像与真实图像,利用设计的体素神经渲染器训练 3D 骨干网络。值得注意的是,我们的方法将学习到的 3D 编码器无缝集成到各类下游任务中。这些任务既涵盖 3D 检测与分割等高层挑战,也包括 3D 重建与图像合成等低层目标,横跨室内与室外场景。此外,我们还展示了利用所提方法预训练 2D 骨干网络的能力,其大幅超越传统预训练方法。PonderV2 首次在 11 个室内外基准上取得最先进性能,印证了其有效性。代码与模型见 https://github.com/OpenGVLab/PonderV2。
引用
@article{arxiv.2310.08586,
title = {PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm},
author = {Haoyi Zhu and Honghui Yang and Xiaoyang Wu and Di Huang and Sha Zhang and Xianglong He and Hengshuang Zhao and Chunhua Shen and Yu Qiao and Tong He and Wanli Ouyang},
journal= {arXiv preprint arXiv:2310.08586},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2301.00157