SERE:探索特征自关系以用于自监督Transformer
计算机视觉与模式识别
2023-09-19 v3
摘要
利用卷积网络(CNN)的自监督学习表征已被证实对视觉任务有效。作为CNN的替代方案,视觉Transformer(ViT)凭借空间自注意力与通道级前馈网络具备强大的表征能力。近期工作表明自监督学习有助于释放ViT的巨大潜力。然而,多数工作沿用为CNN设计的自监督策略(例如样本的实例级判别),却忽略了ViT的特性。我们观察到,在空间与通道维度上的关系建模使ViT区别于其他网络。为强化该特性,我们探索特征自关系(SElf-RElation, SERE)以训练自监督ViT。具体而言,我们并非仅在多视图的特征嵌入上执行自监督学习,而是利用特征自关系(即空间/通道自关系)进行自监督学习。基于自关系的学习进一步增强了ViT的关系建模能力,从而产生更强的表征,稳定提升多项下游任务的性能。我们的源代码公开于:https://github.com/MCG-NKU/SERE。
引用
@article{arxiv.2206.05184,
title = {SERE: Exploring Feature Self-relation for Self-supervised Transformer},
author = {Zhong-Yu Li and Shanghua Gao and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2206.05184},
year = {2023}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)