中文

用于目标检测的 CNN-Transformer 混合模型

计算机视觉与模式识别 2022-12-14 v1

摘要

目标检测作为计算机视觉三大主要任务之一,已应用于多种场景。其主要流程是利用深度神经网络提取图像特征,再依据特征识别物体的类别与位置。因此,提升目标检测任务精度的核心方向在于改进神经网络以更好地提取特征。本文提出一种结合 Transformer[1] 的卷积模块,旨在通过融合 CNN[2] 提取的细节特征与 Transformer 提取的全局特征来提高模型识别精度,并通过压缩特征图(feature mAP)显著降低 Transformer 模块的计算量。主要执行步骤为:卷积下采样以缩小特征图尺寸,继而自注意力计算与上采样,最后与初始输入拼接。实验部分中,将该模块拼接至 YOLOv5n[3] 末端并在 coco 数据集上训练 300 轮后,mAP 较先前 YOLOv5n 提升 1.7%,且 mAP 曲线未现饱和现象,故仍有改进潜力。在 Pascal VOC 数据集上训练 100 轮后,结果准确率达 81%,优于以 resnet101[5] 为骨干的 faster RCNN[4] 4.6 个百分点,而参数量不足其二十分之一。

关键词

引用

@article{arxiv.2212.06714,
  title  = {CNN-transformer mixed model for object detection},
  author = {Wenshuo Li},
  journal= {arXiv preprint arXiv:2212.06714},
  year   = {2022}
}