中文

3A-YOLO:具有三重判别感知与协调表示的新实时目标检测器

计算机视觉与模式识别 2024-12-11 v1

摘要

关于实时目标检测器(如 YOLO 系列)的最新研究展示了注意力机制在提升模型性能方面的有效性。然而,现有方法未能统一地部署分层注意力机制来构建一个更判别性的 YOLO 检测头,该检测头富含更多有用的中间特征。为了弥补这一差距,本工作旨在利用多种注意力机制分层增强 YOLO 检测头的三重判别感知,并互补地学习协调的中间表示,从而产生一系列新的检测器,记为 3A-YOLO。具体而言,我们首先提出一种新的检测头,称为 TDA-YOLO 模块,它统一地增强了尺度感知、空间感知和任务感知的表示学习。其次,我们引导中间特征协调地学习通道间关系和精确的位置信息。最后,我们进行颈部网络改进,并引入各种技巧以提升 3A-YOLO 的适应性。在 COCO 和 VOC 基准上的大量实验表明了我们检测器的有效性。

关键词

引用

@article{arxiv.2412.07168,
  title  = {3A-YOLO: New Real-Time Object Detectors with Triple Discriminative Awareness and Coordinated Representations},
  author = {Xuecheng Wu and Junxiao Xue and Liangyu Fu and Jiayu Nie and Danlei Huang and Xinyi Yin},
  journal= {arXiv preprint arXiv:2412.07168},
  year   = {2024}
}