基于Transformer预测头改进YOLOv5的计算机视觉损伤检测模型
计算机视觉与模式识别
2023-03-09 v1 人工智能
计算机与社会
机器学习
神经与进化计算
摘要
目的:基于计算机视觉的及时准确损伤分类与定位对民用基础设施的监测、安全及可用性具有决定性意义。然而,当前最先进的基于深度学习(DL)的损伤检测模型在复杂噪声环境中常缺乏优越的特征提取能力,限制了准确可靠目标区分的发展。方法:为此,我们提出DenseSPH-YOLOv5,一种基于实时DL的高性能损伤检测模型,其中将DenseNet块集成至主干网络以改进关键特征信息的保留与复用。此外,引入了卷积块注意力模块(CBAM)以提升注意力性能机制,实现强判别性深度空间特征提取,从而在多种挑战性环境下获得优越检测。而且,增加了额外特征融合层与Swin-Transformer预测头(SPH),利用先进自注意力机制更高效检测多尺度目标尺寸并同时降低计算复杂度。结果:在大规模道路损伤数据集(RDD-2018)上评估模型性能,以62.4 FPS检测速率,DenseSPH-YOLOv5取得平均精度均值(mAP)85.25%、F1分数81.18%、精确率(P)89.51%,优于当前最先进模型。意义:本研究提供了一种高效有效的损伤定位模型,通过提供高准确局部边界框预测,弥补了现有基于DL损伤检测模型的不足。当前工作朝实时现场应用中准确鲁棒自动损伤检测系统迈出了一步。
引用
@article{arxiv.2303.04275,
title = {A Computer Vision Enabled damage detection model with improved YOLOv5 based on Transformer Prediction Head},
author = {Arunabha M. Roy and Jayabrata Bhaduri},
journal= {arXiv preprint arXiv:2303.04275},
year = {2023}
}