DINeMo:面向无 3D 标注的神经网格模型学习
计算机视觉与模式识别
2025-06-10 v2
摘要
类别级3D/6D姿态估计是实现全面3D场景理解的关键步骤,这将为机器人和具身 AI 的广泛应用提供支持。近期的研究探索了从分析-合成视角出发的神经网格模型, Despite在部分遮挡和域迁移方面显著提升了鲁棒性,但这些方法高度依赖于3D标注进行部件对比学习,这将其局限于狭窄的类别范围,并阻碍高效扩展。本文提出DINeMo,一款 novel神经网格模型,通过利用来自大型视觉基础模型获取的伪对应关系进行无 3D 标注训练。我们采用双向伪对应生成方法,利用局部外观特征和全局上下文信息生成伪对应。实验结果表明,我们的DINeMo在汽车数据集上优于以前的zero-和few-shot3D姿态估计方法,缩小了与 fully监督方法之间的差距达到67.3%。我们的DINeMo在训练期间 incorporating更多无标注图像时也能有效扩展和高效运行,这表明其优于依赖3D标注的监督学习方法。我们的项目页面可在https://analysis-by-synthesis.github.io/DINeMo/查阅。
引用
@article{arxiv.2503.20220,
title = {DINeMo: Learning Neural Mesh Models with no 3D Annotations},
author = {Weijie Guo and Guofeng Zhang and Wufei Ma and Alan Yuille},
journal= {arXiv preprint arXiv:2503.20220},
year = {2025}
}
备注
Accepted to 3rd Workshop on Compositional 3D Vision at CVPR 2025 (C3DV)