NomMer:面向视觉识别的 Vision Transformer 中协同上下文提名机制
计算机视觉与模式识别
2022-03-15 v2
摘要
近期,以自注意力(SA)为核心组件的 Vision Transformer (ViT) 在计算机视觉领域展现出巨大潜力。为了权衡效率与性能,一部分工作仅在局部 patch 内执行 SA 操作,而放弃了对于视觉识别任务不可或缺的全局上下文信息。为解决该问题,后续的全局-局部 ViT 尝试在模型中以并行或交替的方式将局部 SA 与全局 SA 相结合。然而,穷举组合的局部与全局上下文对于各种视觉数据可能存在冗余,且每层内的感受野是固定的。另一种更优雅的方式是,全局与局部上下文能够自适应地自身贡献以适应不同的视觉数据。为实现这一目标,本文提出了一种新颖的 ViT 架构,命名为 NomMer,它能够在 vision transforMer 中动态地提名(Nominate)协同的全局-局部上下文。通过研究我们提出的 NomMer 的工作模式,我们进一步探索了其聚焦的上下文信息。得益于这种“动态提名”机制,无需任何花哨的技巧,NomMer 不仅能在仅有 73M 参数的情况下在 ImageNet 上实现 84.5% 的 Top-1 分类准确率,还在密集预测任务(即目标检测和语义分割)中展现出优异的性能。代码和模型将在 https://github.com/TencentYoutuResearch/VisualRecognition-NomMer 公开发布。
引用
@article{arxiv.2111.12994,
title = {NomMer: Nominate Synergistic Context in Vision Transformer for Visual Recognition},
author = {Hao Liu and Xinghua Jiang and Xin Li and Zhimin Bao and Deqiang Jiang and Bo Ren},
journal= {arXiv preprint arXiv:2111.12994},
year = {2022}
}
备注
Accepted to CVPR2022