OAMixer:面向视觉 Transformer 的目标感知混合层
计算机视觉与模式识别
2022-12-14 v1 机器学习
摘要
基于图像块(patch)的模型,如 Vision Transformers(ViTs)和 Mixers,已在各类视觉识别任务上展现出令人印象深刻的成果,逐步取代经典卷积网络。尽管最初的基于块的模型(ViTs)平等对待所有图像块,近期研究揭示引入如空间性之类的归纳偏置有益于表征。然而,多数先前工作仅关注图像块的位置,忽视了图像的场景结构。因此,我们旨在利用目标信息进一步引导图像块的交互。具体而言,我们提出 OAMixer(目标感知混合层),其基于目标标签对基于块的模型的块混合层进行校准。此处我们以无监督或弱监督方式获取目标标签,即无需额外的人工标注成本。利用目标标签,OAMixer 通过可学习的尺度参数计算重加权掩码,该掩码增强含相似目标图像块间的交互,并将掩码应用于块混合层。通过学习以对象为中心的表征,我们证明 OAMixer 提升了包括 ViTs、MLP-Mixers 和 ConvMixers 在内的多种基于块的模型的分类准确率与背景鲁棒性。此外,我们展示 OAMixer 增强了包括大规模分类、自监督学习和多目标识别在内的多种下游任务,验证了 OAMixer 的通用适用性。
引用
@article{arxiv.2212.06595,
title = {OAMixer: Object-aware Mixing Layer for Vision Transformers},
author = {Hyunwoo Kang and Sangwoo Mo and Jinwoo Shin},
journal= {arXiv preprint arXiv:2212.06595},
year = {2022}
}
备注
CVPR Transformers for Vision Workshop 2022. First two authors contributed equally