中文

YOLO架构在道路损伤检测与分类中的优化:从YOLOv7到YOLOv10的比较研究

计算机视觉与模式识别 2024-10-14 v1

摘要

维持道路基础设施是确保安全、高效和可持续交通系统的关键。然而,手动收集道路损伤检测数据耗时、代价高昂且存在安全风险。近期的人工智能,特别是深度学习技术,为使用道路图像自动化此过程提供了有前景的解决方案。本文提出了一套完整的道路损伤检测工作流程,专注于在保持检测精度的同时优化推理速度。具体而言,为了适应硬件限制,对大图像进行裁剪,并采用轻量级模型。此外,融合外部掘洞数据集以增强对该欠代表的损伤类别的检测。所提出的方法采用多种模型架构,包括带有坐标注意力层的自定义YOLOv7模型和Tiny YOLOv7模型,这些模型经过训练和组合,以最大化检测性能。模型进一步进行重参数化,以优化推理效率。实验结果表明,自定义YOLOv7模型(包含三个坐标注意力层)和默认Tiny YOLOv7模型的集成在检测精度达到0.7027的F1分数,推理速度为每张图像0.0547秒。包括数据预处理、模型训练和推理脚本的完整管道已公开于项目GitHub存储库,实现可重复性并促进进一步研究。

关键词

引用

@article{arxiv.2410.08409,
  title  = {Optimizing YOLO Architectures for Optimal Road Damage Detection and Classification: A Comparative Study from YOLOv7 to YOLOv10},
  author = {Vung Pham and Lan Dong Thi Ngoc and Duy-Linh Bui},
  journal= {arXiv preprint arXiv:2410.08409},
  year   = {2024}
}

备注

Invited paper in the Optimized Road Damage Detection Challenge (ORDDC'2024), a track in the IEEE BigData 2024 Challenge