嫁接视觉Transformer
计算机视觉与模式识别
2023-04-04 v2
摘要
视觉Transformer(ViT)近来已成为许多计算机视觉任务上的最先进方法。与卷积网络(CNN)不同,ViT即使在网络的浅层(即高分辨率特征之间)也能实现全局信息共享。然而,随着Swin Transformer等金字塔架构的成功,这一优势后来被忽视,后者展现出更好的性能-复杂度权衡。本文提出一个简单高效的附加组件(称为GrafT),它在整个网络中同时考虑高分辨率与低分辨率特征下的全局依赖与多尺度信息。它具有在任意深度分叉的灵活性,并共享主干的大部分参数与计算。GrafT在多种知名模型上展现出一致增益,包括混合与纯Transformer类型、同质与金字塔结构,以及各类自注意力方法。特别地,它通过提供高层语义大幅惠及移动端尺寸模型。在ImageNet-1k数据集上,GrafT分别为DeiT-T、Swin-T和MobileViT-XXS带来+3.9%、+1.4%和+1.9%的top-1准确率提升。我们的代码与模型将公开。
引用
@article{arxiv.2210.15943,
title = {Grafting Vision Transformers},
author = {Jongwoo Park and Kumara Kahatapitiya and Donghyun Kim and Shivchander Sudalairaj and Quanfu Fan and Michael S. Ryoo},
journal= {arXiv preprint arXiv:2210.15943},
year = {2023}
}