BatchFormerV2:探索样本关系用于稠密表示学习
计算机视觉与模式识别
2022-04-05 v1 人工智能
摘要
注意力机制在深度神经网络中非常流行,其中Transformer架构不仅在自然语言处理而且在视觉识别应用中都取得了巨大成功。最近,一个新的Transformer模块被引入,应用于批次维度而非空间/通道维度,即BatchFormer[18],用于探索样本关系以克服数据稀缺挑战。然而,它仅适用于图像级表示进行分类。在本文中,我们设计了一个更通用的批次Transformer模块BatchFormerV2,它进一步支持探索样本关系用于稠密表示学习。具体而言,当应用所提模块时,它在训练期间采用双流流水线,即带或不带BatchFormerV2模块,其中batchformer流在测试时可被移除。因此,所提方法是一个即插即用模块,可轻松集成到不同的视觉Transformer中而无需任何额外推理成本。不加任何修饰,我们展示了所提方法对多种流行视觉识别任务的有效性,包括图像分类和两个重要的稠密预测任务:目标检测和全景分割。特别地,BatchFormerV2使当前基于DETR的检测方法(如DETR、Deformable-DETR、Conditional DETR和SMCA)持续提升超过1.3%。代码将公开可用。
引用
@article{arxiv.2204.01254,
title = {BatchFormerV2: Exploring Sample Relationships for Dense Representation Learning},
author = {Zhi Hou and Baosheng Yu and Chaoyue Wang and Yibing Zhan and Dacheng Tao},
journal= {arXiv preprint arXiv:2204.01254},
year = {2022}
}
备注
Tech report