中文

面向低标注高数据场景的基于自监督注意力的视觉表征学习

计算机视觉与模式识别 2022-02-01 v2 机器学习

摘要

自监督在自然语言处理中已展现出卓越成果,近来在图像识别中也是如此。同时,视觉 Transformer 及其变体已成为在各种计算机视觉任务上替代卷积的一种有前景且可扩展的方案。在本文中,我们首次探讨自监督视觉 Transformer(SSL-ViTs)能否被适配到低标注、高数据场景下的两个重要计算机视觉任务:少样本图像分类和零样本图像检索。其动机是减少训练视觉嵌入器所需的手动标注数量,并生成可泛化且语义上有意义的嵌入。对于少样本图像分类,我们在无监督情况下于外部数据上训练 SSL-ViTs,并利用该训练好的嵌入器以有限数量的标签快速适配新类别。对于零样本图像检索,我们使用在无标签大规模数据集上预训练的 SSL-ViTs,并以若干度量学习目标对其进行微调。我们的自监督注意力表征在两项任务的多个公开基准上均优于当前最优方法,具体而言,在少样本图像分类的 miniImageNet 和 CUB200 上提升达 6%–10%,在零样本图像检索的 Stanford Online Products、Cars196 和 CUB200 上提升达 4%–11%。代码见 \url{https://github.com/AutoVision-cloud/SSL-ViT-lowlabel-highdata}。

关键词

引用

@article{arxiv.2201.08951,
  title  = {Visual Representation Learning with Self-Supervised Attention for Low-Label High-data Regime},
  author = {Prarthana Bhattacharyya and Chenge Li and Xiaonan Zhao and István Fehérvári and Jason Sun},
  journal= {arXiv preprint arXiv:2201.08951},
  year   = {2022}
}

备注

Accepted to ICASSP-2022