中文

DINO-YOLO:面向民航工程应用的数据高效目标检测的自监督预训练方法

计算机视觉与模式识别 2025-11-03 v2 人工智能

摘要

民航工程应用中的目标检测受限于专业领域的标注数据有限。我们提出DINO-YOLO,一种结合YOLOv12与DINOv3自监督视觉变换器的数据高效检测混合架构。DINOv3特征 strategically integrated at two locations: 输入预处理(P0)和中背骨增强(P3)。实验验证表明,显著改进:隧道段裂缝检测(648张图像)提升12.4%,施工防护装备(1K图像)提升13.7%,KITTI(7K图像)提升88.6%,同时保持实时推理(30-47 FPS)。在五个YOLO尺度和九个DINOv3变体的系统消融实验中,发现中等规模架构在双P0P3集成(55.77% [email protected])下表现最佳,小规模需要三重集成(53.63%)。2-4倍推理开销(21-33ms vs 8-16ms基线)在NVIDIA RTX 5090上仍可接受。DINO-YOLO在民航工程数据集(<10K图像)上实现最先进性能,同时保持计算效率,为受数据限制的环境中提供建筑安全监控和基础设施检测的实用解决方案。

关键词

引用

@article{arxiv.2510.25140,
  title  = {DINO-YOLO: Self-Supervised Pre-training for Data-Efficient Object Detection in Civil Engineering Applications},
  author = {Malaisree P and Youwai S and Kitkobsin T and Janrungautai S and Amorndechaphon D and Rojanavasu P},
  journal= {arXiv preprint arXiv:2510.25140},
  year   = {2025}
}