CDG-MAE:从扩散生成视图中学习对应关系
计算机视觉与模式识别
2025-06-24 v1
摘要
学习稠密对应关系对于视频标签传递等应用至关重要,但受限于繁琐且不可扩展的手动标注。自监督方法通过使用交叉视图预任务模型来解决这一问题,通常采用掩码自编码器,其中被掩码的目标视图从锚定视图中重建。然而,获取有效训练数据的挑战依然存在——收集多样化视频数据集困难且成本高昂,而简单的图像裁剪缺乏必要的姿态变化。本文引入 CDG-MAE,一种基于 MAE 的自监督方法,使用通过图像条件扩散模型生成的多样化合成视图。这些生成视图在姿态和视角上具有显著的变化,为克服视频和裁剪锚点的局限性提供了丰富的训练信号。我们提出了一种定量方法来评估生成图像的局部和全局一致性,讨论其在跨视图自监督预训练中的应用。此外,我们将标准的单锚点 MAE 设置增强为多锚点策略,以有效调节预任务的难度。CDG-MAE 在依赖图像的领先 MAE 方法上显著优于,并大幅缩小了与基于视频的方法之间的性能差距。
引用
@article{arxiv.2506.18164,
title = {CDG-MAE: Learning Correspondences from Diffusion Generated Views},
author = {Varun Belagali and Pierre Marza and Srikar Yellapragada and Zilinghan Li and Tarak Nath Nandi and Ravi K Madduri and Joel Saltz and Stergios Christodoulidis and Maria Vakalopoulou and Dimitris Samaras},
journal= {arXiv preprint arXiv:2506.18164},
year = {2025}
}