通过探测注意力条件化掩码一致性适配自监督视觉 Transformer
计算机视觉与模式识别
2022-06-17 v1 机器学习
摘要
视觉域适配(DA)旨在将训练好的模型迁移到分布偏移下未见且无标签的域,但现有方法通常侧重于适配以有监督 ImageNet 表征初始化的卷积神经网络架构。在本工作中,我们将焦点转向适配用于物体识别的现代架构——日益流行的 Vision Transformer (ViT)——以及基于自监督学习(SSL)的现代预训练。受近期基于从通过掩码或裁剪生成的局部图像输入中学习的 SSL 方法设计启发——或通过预测缺失像素,或学习对此类增强的表征不变性——我们提出 PACMAC,一种用于自监督 ViT 的简单两阶段适配算法。PACMAC 首先在汇聚的源域与目标域数据上执行域内 SSL 以学习任务判别特征,随后通过一种新颖的注意力条件化掩码策略生成的一组局部目标输入,探测模型预测一致性,以识别用于自训练的可靠候选。我们的简单方法在标准物体识别基准上,相对于使用 ViT 与自监督初始化的竞争方法带来了稳定的性能提升。代码见 https://github.com/virajprabhu/PACMAC
引用
@article{arxiv.2206.08222,
title = {Adapting Self-Supervised Vision Transformers by Probing Attention-Conditioned Masking Consistency},
author = {Viraj Prabhu and Sriram Yenamandra and Aaditya Singh and Judy Hoffman},
journal= {arXiv preprint arXiv:2206.08222},
year = {2022}
}