面向视觉预训练任务的自内多样性与不变性探索
计算机视觉与模式识别
2021-06-02 v1
摘要
近来,自监督学习方法在视觉预训练任务中取得了显著成功。通过简单地将每幅图像的不同增强视图拉到一起或其他新颖机制,它们可以学习大量无监督知识并显著提升预训练模型的迁移性能。然而,这些工作仍无法避免表示崩塌问题,即它们仅关注有限区域或每幅图像内完全不同区域上提取的特征几乎相同。通常,该问题使得预训练模型无法充分描述图像内的多粒度信息,进而限制了其迁移性能的上限。为缓解此问题,本文引入一种简单而有效的机制,称为自内多样性与不变性探索(E-DIY)。通过简单地将每个增强视图内差异最大的区域推远,E-DIY可以保留所提取区域级特征的多样性。通过将同一图像不同增强视图中最相似的区域拉到一起,E-DIY可以确保区域级特征的鲁棒性。得益于上述多样性与不变性探索机制,E-DIY最大限度地提取了每幅图像内的多粒度视觉信息。在下游任务上的大量实验证明了我们所提方法的优越性,例如,在使用R50-C4骨干网络和1X学习 schedule 微调Mask R-CNN时,相比强基线BYOL在COCO上有2.1%的提升。
引用
@article{arxiv.2106.00537,
title = {Exploring the Diversity and Invariance in Yourself for Visual Pre-Training Task},
author = {Longhui Wei and Lingxi Xie and Wengang Zhou and Houqiang Li and Qi Tian},
journal= {arXiv preprint arXiv:2106.00537},
year = {2021}
}