用于密集预测的Vision Transformer适配器
计算机视觉与模式识别
2023-02-14 v4
摘要
这项工作研究了一种简单而强大的用于Vision Transformer (ViT)的密集预测任务适配器。与最近那些将视觉特定的归纳偏置融入其架构的先进变体不同,普通的ViT由于先验假设较弱,在密集预测任务上性能较差。为了解决这个问题,我们提出了ViT-Adapter,它使得普通的ViT能够达到与视觉特定Transformer相当的性能。具体来说,我们框架中的骨干网络是一个普通的ViT,它可以从大规模多模态数据中学习强大的表示。当迁移到下游任务时,使用一个无需预训练的适配器将图像相关的归纳偏置引入模型,使其适用于这些任务。我们在多个密集预测任务上验证了ViT-Adapter,包括目标检测、实例分割和语义分割。值得注意的是,在不使用额外检测数据的情况下,我们的ViT-Adapter-L在COCO test-dev上取得了最先进的60.9 box AP和53.0 mask AP。我们希望ViT-Adapter能够作为视觉特定Transformer的替代方案,并促进未来的研究。代码和模型将在https://github.com/czczup/ViT-Adapter发布。
引用
@article{arxiv.2205.08534,
title = {Vision Transformer Adapter for Dense Predictions},
author = {Zhe Chen and Yuchen Duan and Wenhai Wang and Junjun He and Tong Lu and Jifeng Dai and Yu Qiao},
journal= {arXiv preprint arXiv:2205.08534},
year = {2023}
}
备注
Accepted to ICLR 2023