中文

解耦数据增强与格式变换在图像表示自监督学习中的效应

计算机视觉与模式识别 2023-12-06 v1 机器学习

摘要

自监督学习 (SSL) 能够使用有限的标注数据训练高性能模型。视觉 SSL 的支柱之一是对输入使用不显著改变其语义内容的数据增强/扰动。对于音频和其他时序信号,增强通常与傅里叶变换或小波变换等格式变换结合使用。与增强不同,格式变换不改变数据中包含的信息;而是以不同的坐标表示相同的信息。本文分别研究了格式变换和增强对视觉 SSL 的单独和共同影响。我们定义了频域中的增强,称为傅里叶域增强 (FDA),并表明在这些增强与图像增强的组合上训练 SSL 模型,可以使 ImageNet-1K 上的下游分类准确率提高多达 1.3%。我们还展示了在少样本和迁移学习设置下,使用 FDA 相对于 SSL 基线取得了改进。令人惊讶的是,我们还观察到,即使没有增强,格式变换也能提高学习表示的质量;然而,这两种技术的结合能产生更好的质量。

关键词

引用

@article{arxiv.2312.02205,
  title  = {Disentangling the Effects of Data Augmentation and Format Transform in Self-Supervised Learning of Image Representations},
  author = {Neha Kalibhat and Warren Morningstar and Alex Bijamov and Luyang Liu and Karan Singhal and Philip Mansfield},
  journal= {arXiv preprint arXiv:2312.02205},
  year   = {2023}
}