中文

对抗样本融合掩码图像建模

计算机视觉与模式识别 2024-07-17 v1 人工智能

摘要

掩码图像建模(MIM)因其在 representation learning 方面的卓越能力而获得了广泛关注。作为传统方法的替代方案,来自受损图像的重建最近作为一种有前景的预训练任务而涌现。然而,常规受损图像是使用通用生成器生成的,往往缺乏针对预训练中特定重建任务的相关性。因此,来自常规受损图像的重建不能确保预文本任务的难度,可能导致性能下降。此外,生成受损图像可能引入额外的生成器,导致显著的计算负担。为此,我们提出将对抗样本融合到掩码图像建模中,作为新的重建目标。使用仅由训练模型生成的对抗样本,可直接针对预训练相关任务进行干扰。因此,该融合不仅提升了重建难度,还增强了效率,促进模型获取更佳表示。具体而言,我们引入一种新型辅助预文本任务,以重建对应原始图像的对抗样本。我们还设计了一种创新的对抗攻击,以为MIM预训练制造更合适的对抗样本。值得注意的是,我们的方法不局限于特定模型架构和 MIM 策略,因而是一个具有适应性的插件,可增强所有 MIM 方法。实验结果证实,我们方法在放大现有 MIM 方法的泛化性和鲁棒性方面具有惊人的能力。值得注意的是,我们的方法在各种任务上(包括ImageNet、其变体及其他下游任务)的性能均显著优于基线方法。

关键词

引用

@article{arxiv.2407.11537,
  title  = {AEMIM: Adversarial Examples Meet Masked Image Modeling},
  author = {Wenzhao Xiang and Chang Liu and Hang Su and Hongyang Yu},
  journal= {arXiv preprint arXiv:2407.11537},
  year   = {2024}
}

备注

Under review of International Journal of Computer Vision (IJCV)