YOLOSA:基于二维局部特征叠加自注意力的目标检测
计算机视觉与模式识别
2023-05-09 v2 人工智能
摘要
我们分析了实时目标检测模型的网络结构,发现特征拼接阶段的特徵非常丰富。在此处施加注意力模块可有效提升模型检测精度。然而,常用的注意力模块或自注意力模块在检测精度与推理效率上表现欠佳。因此,我们提出一种新颖的自注意力模块,称为二维局部特征叠加自注意力,用于颈网络的特征拼接阶段。该自注意力模块通过局部特征与局部感受野反映全局特征。我们还提出并优化了高效解耦头与 AB-OTA,取得了 SOTA 结果。使用我们所提改进构建的大、中、小型模型平均精度分别为 49.0%(71FPS,14ms)、46.1%(85FPS,11.7ms)与 39.1%(107FPS,9.3ms)。我们的模型在平均精度上超出 YOLOv5 0.8%--3.1%。
引用
@article{arxiv.2206.11825,
title = {YOLOSA: Object detection based on 2D local feature superimposed self-attention},
author = {Weisheng Li and Lin Huang},
journal= {arXiv preprint arXiv:2206.11825},
year = {2023}
}
备注
This paper is under consideration at Pattern Recognition Letters