中文

MC-SSL0.0:迈向多概念自监督学习

计算机视觉与模式识别 2021-12-01 v1 机器学习

摘要

自监督预训练是自然语言处理模型的首选方法,并正迅速在众多视觉任务中流行。近来,自监督预训练已表明在许多下游视觉应用中优于有监督预训练,标志着该领域的里程碑。这种优越性归因于训练图像不完整标注的负面影响——这些图像传达多个概念,却仅用单一主导类标签标注。尽管自监督学习(SSL)原则上不受此限制,但促进 SSL 的代理任务的选择正通过将学习过程导向单一概念输出而延续这一缺陷。本研究旨在探究在不使用标签的情况下对图像中所有概念建模的可能性。在这方面,所提出的 SSL 框架 MC-SSL0.0 是迈向多概念自监督学习(MC-SSL)的一步,其超越对图像中单一主导标签建模,以有效利用图像中所有概念的信息。MC-SSL0.0 包含两个核心设计概念:分组掩码模型学习,以及使用动量编码器(教师-学生)框架对数据令牌的伪概念学习。在多标签与多类图像分类下游任务上的实验结果表明,MC-SSL0.0 不仅超越现有 SSL 方法,还优于有监督迁移学习。源代码将公开以供社区在更大数据集上训练。

关键词

引用

@article{arxiv.2111.15340,
  title  = {MC-SSL0.0: Towards Multi-Concept Self-Supervised Learning},
  author = {Sara Atito and Muhammad Awais and Ammarah Farooq and Zhenhua Feng and Josef Kittler},
  journal= {arXiv preprint arXiv:2111.15340},
  year   = {2021}
}