中文

SemanticMIM:融合语义压缩的掩码图像建模用于通用视觉表征

计算机视觉与模式识别 2024-06-18 v1

摘要

本文提出了一个简洁而有效的框架,名为SemanticMIM,旨在整合掩码图像建模(MIM)和对比学习(CL)的优势,用于通用视觉表征。我们对CL和MIM进行了深入的比较分析,揭示出它们互补的优势根本上源于两个不同的阶段,即压缩和重建。具体来说,SemanticMIM利用一个代理架构来定制图像令牌和掩码令牌之间的交互,桥接这两个阶段,从而获得兼具丰富语义和位置感知特性的通用视觉表征。通过广泛的定性和定量评估,我们证明了SemanticMIM有效地融合了CL和MIM的优点,显著提升了性能和特征的线性可分性。SemanticMIM还通过注意力响应可视化提供了显著的可解释性。代码可在 https://github.com/yyk-wew/SemanticMIM 获取。

关键词

引用

@article{arxiv.2406.10673,
  title  = {SemanticMIM: Marring Masked Image Modeling with Semantics Compression for General Visual Representation},
  author = {Yike Yuan and Huanzhang Dou and Fengjun Guo and Xi Li},
  journal= {arXiv preprint arXiv:2406.10673},
  year   = {2024}
}