MuM:用于 3D 视觉的多视图掩码图像建模
计算机视觉与模式识别
2025-11-24 v1 人工智能
机器学习
摘要
图像上的自监督学习旨在从无标签数据中提取有意义的视觉表征。当规模化到大型数据集时,这一范式已实现最先进的性能,其训练得到的模型(如 DINOv3)已广泛采用。然而,大多数先前工作针对语义理解进行优化,而非几何推理。一个重要例外是 CroCo,即一种针对 3D 理解的掩码自编码(MAE)形式。在本工作中,我们沿袭 CroCo 的路径,专注于学习针对 3D 视觉的特征。在简要而言,我们将 MAE 扩展到同一场景的任意数量视图。通过对所有视图进行统一掩码处理,并采用带有帧间注意力的轻量解码器,我们的方法在本质上更简单且更具可扩展性。我们广泛评估了所得模型 MuM 在下游任务上的表现,包括前馈重建、稠密图像配对和相对姿态估计,发现其优于最先进的视觉编码器 DINOv3 和 CroCo v2。
引用
@article{arxiv.2511.17309,
title = {MuM: Multi-View Masked Image Modeling for 3D Vision},
author = {David Nordström and Johan Edstedt and Fredrik Kahl and Georg Bökman},
journal= {arXiv preprint arXiv:2511.17309},
year = {2025}
}