中文

掩码图像建模:综述

计算机视觉与模式识别 2025-07-11 v3 人工智能 机器学习

摘要

在本工作中,我们综述了近期在计算机视觉中出现的掩码图像建模 (MIM) 方法,这是一种强大的自监督学习技术。MIM 任务涉及对某些信息(例如像素、图块或甚至潜在表示)进行掩码处理,然后训练模型(通常是自动编码器)以预测可见部分输入中可用上下文中的缺失信息。我们确定并形式化了两种在 MIM 中实现为预置任务的方法:一种基于重建,另一种基于对比学习。然后,我们构建了稍纵即川的分类法,并综述了近年来最突出的论文。我们通过应用层次聚类算法获得的树状图补充了手动构建的分类法。我们进一步通过手动检查结果树状图来识别相关聚类。我们的综述还包括在 MIM 研究中常用的数据集。我们汇总了各种掩码图像建模方法在最受欢迎数据集上的性能结果,以便比较各种方法。最后,我们确定了研究空白并提出了若干有趣的未来工作方向。我们补充了包含组织化参考文献的公开存储库:https://github.com/vladhondru25/MIM-Survey。

关键词

引用

@article{arxiv.2408.06687,
  title  = {Masked Image Modeling: A Survey},
  author = {Vlad Hondru and Florinel Alin Croitoru and Shervin Minaee and Radu Tudor Ionescu and Nicu Sebe},
  journal= {arXiv preprint arXiv:2408.06687},
  year   = {2025}
}

备注

Accepted at the International Journal of Computer Vision