多视角等变性提高了 3D 对应物理解能力,所需最少的特征微调
计算机视觉与模式识别
2025-02-20 v2
摘要
视觉基础模型,特别是 ViT 系列模型,已通过提供丰富语义特征来彻底改变图像理解。然而,尽管它们在 2D 理解方面取得了成功,但在把握 3D 空间关系方面的能力仍不明确。本文评估并提升了 ViT 基于模型的 3D 感知能力。我们系统性地评估了其学习 3D 等变特征的能力,具体检查了不同视角下语义嵌入的一致性。我们的发现表明,改进的 3D 等变性在各种下游任务(包括姿态估计、跟踪和语义传递)上表现更好。基于这一洞见,我们提出一种简单而有效的微调策略,基于 3D 对应物,显著提升了现有视觉模型的 3D 对应物理解能力。值得注意的是,对单个对象进行一次迭代即可获得显著提升。我们的代码已公开:https://github.com/qq456cvb/3DCorrEnhance。
引用
@article{arxiv.2411.19458,
title = {Multiview Equivariance Improves 3D Correspondence Understanding with Minimal Feature Finetuning},
author = {Yang You and Yixin Li and Congyue Deng and Yue Wang and Leonidas Guibas},
journal= {arXiv preprint arXiv:2411.19458},
year = {2025}
}
备注
10 pages; Accepted to ICLR 2025