中文

MixDiff:用于稳健自监督表征的混合自然与合成图像

计算机视觉与模式识别 2024-12-06 v2

摘要

本文介绍MixDiff,这是一个新的自监督学习(SSL)预训练框架,将真实图像与合成图像相结合。不同于传统SSL方法主要使用真实图像,MixDiff使用Stable Diffusion的变体替换真实图像的增强实例,促进跨真实-合成图像表征的学习。我们的关键洞察是:虽然仅使用合成图像训练的模型表现不佳,但结合真实与合成数据可获得更稳健、更具适应性的表征。实验表明,MixDiff在各种鲁棒性数据集和域迁移任务中提升了SimCLR、BarlowTwins和DINO的性能,使SimCLR在ImageNet-1K准确率提升4.56%。我们的框架还在无需任何增强的情况下实现了相当水平的性能,这一发现在SSL中通常高度依赖增强这一背景下颇具惊人性。

关键词

引用

@article{arxiv.2406.12368,
  title  = {MixDiff: Mixing Natural and Synthetic Images for Robust Self-Supervised Representations},
  author = {Reza Akbarian Bafghi and Nidhin Harilal and Claire Monteleoni and Maziar Raissi},
  journal= {arXiv preprint arXiv:2406.12368},
  year   = {2024}
}

备注

Accepted in WACV 2025