中文

基于 RFAConv 和三重注意力机制的自动驾驶图像检测优化

计算机视觉与模式识别 2024-07-16 v1 人工智能 机器人学

摘要

YOLOv8 在自动驾驶领域发挥着关键作用,由于其高速目标检测、精准识别与定位以及在多个平台上的广泛兼容性。该模型能够实时处理视频流或图像,迅速准确地识别道路上的障碍物,如车辆和行人,为自动驾驶系统提供essential视觉数据。此外,YOLOv8 支持包括实例分割、图像分类和姿态估计等多种任务,从而为自动驾驶提供全面的视觉感知,最终提升驾驶安全性和效率。鉴于目标检测在自动驾驶场景中的重要性以及现有方法面临的挑战,本文提出了一种全面的方法来增强 YOLOv8 模型。该研究引入了两个关键修改:C2f_RFAConv 模块和三重注意力机制。首先,在方法论部分详细阐述了所提出的修改。C2f_RFAConv 模块取代原模块以提高特征提取效率,而三重注意力机制则增强特征聚焦。随后,实验部分阐述了训练和评估流程,包括训练原始 YOLOv8、集成修改模块以及使用指标和 PR 曲线评估性能提升。结果表明,所述修改具有有效性,改进后的 YOLOv8 模型在 MAP值提升以及 PR 曲线改善方面均实现显著性能提升。最后,分析部分阐明了结果并归因于所引入的模块。C2f_RFAConv 提高了特征提取效率,而三重注意力机制则提高了特征聚焦,以实现更佳的目标检测。

关键词

引用

@article{arxiv.2407.09530,
  title  = {Optimization of Autonomous Driving Image Detection Based on RFAConv and Triplet Attention},
  author = {Zhipeng Ling and Qi Xin and Yiyu Lin and Guangze Su and Zuwei Shui},
  journal= {arXiv preprint arXiv:2407.09530},
  year   = {2024}
}

备注

13 pages