ViDT:一种高效且有效的全 Transformer 目标检测器
计算机视觉与模式识别
2021-11-30 v2 机器学习
摘要
Transformers 正在改变计算机视觉的格局,尤其是识别任务。Detection transformers 是首个用于目标检测的全端到端学习系统,而 vision transformers 是首个用于图像分类的全基于 transformer 的架构。本文中,我们整合 Vision 与 Detection Transformers(ViDT)以构建高效且有效的目标检测器。ViDT 引入重新配置的注意力模块,将最近的 Swin Transformer 扩展为独立的物体检测器,其后接一个计算高效的 transformer 解码器,该解码器利用多尺度特征与辅助技术,以在不显著增加计算负载的情况下提升检测性能。在 Microsoft COCO 基准数据集上的广泛评估结果表明,ViDT 在现有全基于 transformer 的目标检测器中获得了最佳的 AP 与延迟权衡,并凭借其对大型模型的高可扩展性达到了 49.2AP。我们将在 https://github.com/naver-ai/vidt 发布代码与训练好的模型。
引用
@article{arxiv.2110.03921,
title = {ViDT: An Efficient and Effective Fully Transformer-based Object Detector},
author = {Hwanjun Song and Deqing Sun and Sanghyuk Chun and Varun Jampani and Dongyoon Han and Byeongho Heo and Wonjae Kim and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2110.03921},
year = {2021}
}
备注
This is a revised version on Nov. 29