中文

GMML即你所需要的一切

计算机视觉与模式识别 2022-05-31 v1

摘要

视觉Transformer在计算机视觉界引起了极大兴趣,因为它们在利用上下文信息(无论是严格局限的局部还是长距离全局)方面具有灵活性。然而,众所周知它们需要大量数据。这推动了自监督Transformer预训练的研究,其无需解码标签所传达的语义信息以将其与图像属性关联,而是直接聚焦于提取反映相似性概念且对干扰因素不变的图像数据的简洁表示。大多数自学习方法用于自学习过程的关键手段是生成训练数据的多个视图,并创建利用这些视图定义图像相似性和数据完整性的 pretext 任务。然而,该方法缺乏提取上下文信息的天然倾向。我们提出分组掩码模型学习(GMML),一种用于预训练视觉Transformer的自监督学习(SSL)机制,能够提取图像中所有概念存在的上下文信息。GMML通过随机操纵连接的令牌组,从而覆盖语义概念的有意义部分,然后从概念的可见部分恢复隐藏的语义信息来实现这一点。GMML隐式引入了一种新颖的数据增强过程。与大多数现有SSL方法不同,GMML不需要动量编码器,也不依赖大批次和梯度停止等精细实现细节,这些均为当前大多数自监督学习技术的产物。源代码已公开供社区在更大数据集上训练:https://github.com/Sara-Ahmed/GMML。

关键词

引用

@article{arxiv.2205.14986,
  title  = {GMML is All you Need},
  author = {Sara Atito and Muhammad Awais and Josef Kittler},
  journal= {arXiv preprint arXiv:2205.14986},
  year   = {2022}
}