中文

CvT-ASSD:基于卷积视觉Transformer的注意力单发多框检测器

计算机视觉与模式识别 2021-10-26 v1 人工智能 机器学习

摘要

由于双向编码器表示来自Transformer(BERT)在自然语言处理(NLP)中的成功,多头注意力Transformer在计算机视觉研究(CV)中愈发流行。然而,在视觉检测与语义分割等复杂任务上取得进展对研究者仍是挑战。尽管已提出DETR与ViT-FRCNN等多种基于Transformer的架构来完成目标检测任务,但传统自注意力操作带来的海量学习参数与沉重计算复杂度不可避免地降低了判别精度并拖慢计算效率。为缓解这些问题,我们提出一种新颖目标检测架构,称为基于卷积视觉Transformer的注意力单发多框检测器(CvT-ASSD),其构建于卷积视觉Transformer(CvT)与高效注意力单发多框检测器(ASSD)之上。我们提供了充分的实证表明,模型CvT-ASSD在PASCAL VOC与MS COCO等大规模检测数据集上预训练时,能带来良好的系统效率与性能。代码已发布于公开github仓库:https://github.com/albert-jin/CvT-ASSD。

关键词

引用

@article{arxiv.2110.12364,
  title  = {CvT-ASSD: Convolutional vision-Transformer Based Attentive Single Shot MultiBox Detector},
  author = {Weiqiang Jin and Hang Yu and Hang Yu},
  journal= {arXiv preprint arXiv:2110.12364},
  year   = {2021}
}

备注

9 pages;5 figures; conference: IEEE ICTAI; Acknowledgment: The research reported in this paper was supported in part by the National Natural Science Foundation of China under the grant 91746203 and the Outstanding Academic Leader Project of Shanghai under the grant No.20XD1401700