UniNeXt:探索视觉识别的统一架构
计算机视觉与模式识别
2023-12-25 v3
摘要
Vision Transformers 已在计算机视觉任务中展现出巨大潜力。近期多数工作聚焦于精心设计方案空间 token 混合器(spatial token mixer)以获取性能提升。然而,我们观察到,一个设计良好的通用架构能够显著提升整个骨干网络的性能,而无论其装备何种空间 token 混合器。本文中,我们提出 UniNeXt,一种用于视觉骨干网络的改进通用架构。为验证其有效性,我们使用多种典型与现代设计(包括卷积与注意力模块)实例化空间 token 混合器。相较于它们首次被提出时的架构,我们的 UniNeXt 架构能稳定提升所有空间 token 混合器的性能,并缩小它们之间的性能差距。令人惊讶的是,装备朴素局部窗口注意力的 UniNeXt 甚至超越了先前的最先进(state-of-the-art, SOTA)方法。有趣的是,这些空间 token 混合器在 UniNeXt 下的排名也发生了变化,表明优秀的空间 token 混合器可能因次优的通用架构而受抑,这进一步显示了视觉骨干网络通用架构研究的重要性。
引用
@article{arxiv.2304.13700,
title = {UniNeXt: Exploring A Unified Architecture for Vision Recognition},
author = {Fangjian Lin and Jianlong Yuan and Sitong Wu and Fan Wang and Zhibin Wang},
journal= {arXiv preprint arXiv:2304.13700},
year = {2023}
}
备注
Accep by ACM MM 2023