中文

MixMask:重新审视孪生卷积网络中的掩码策略

计算机视觉与模式识别 2024-11-12 v4 人工智能 机器学习

摘要

自监督学习的最新进展已成功将掩码图像建模(MIM)与孪生网络相结合,融合了两种方法的优势。然而,在孪生卷积网络(Siamese ConvNets)中集成传统的基于擦除的掩码时仍存在若干挑战。两个主要问题是:(1)卷积网络连续数据处理的性质不允许排除无信息的掩码区域,导致相比 ViT 架构训练效率降低;(2)基于擦除的掩码与基于对比的目标之间不匹配,使其区别于 MIM 技术。为应对这些挑战,本文提出一种新颖的基于填充的掩码方法,称为 \textbf{MixMask}。所提方法用另一幅图像的内容替换被擦除区域,有效缓解了传统掩码方法中的信息损耗。此外,我们提出了一种自适应损失函数,捕捉新拼接视图的语义,确保在该架构框架内的无缝集成。我们通过跨多个数据集和应用场景的综合实验实证验证了方法的有效性。结果强调了我们的框架在线性探测、半监督与有监督微调、目标检测与分割等方面的性能提升。值得注意的是,我们的方法超越了 MSCN,确立了 MixMask 作为孪生卷积网络更具优势的掩码方案。我们的代码与模型已公开于 https://github.com/kirill-vish/MixMask。

关键词

引用

@article{arxiv.2210.11456,
  title  = {MixMask: Revisiting Masking Strategy for Siamese ConvNets},
  author = {Kirill Vishniakov and Eric Xing and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2210.11456},
  year   = {2024}
}

备注

Technical report. Code is available at https://github.com/kirill-vish/MixMask