中文

基于 YOLO 的车辆图像知识提取:基准研究

计算机视觉与模式识别 2025-07-28 v1

摘要

准确识别车辆属性(如车型、颜色和形状)对于执法和情报应用至关重要。本研究评估了三种最新的深度学习方法——YOLO-v11、YOLO-World 和 YOLO-Classification——在真实世界车辆图像数据集上的有效性。该数据集由 NSW警方高速公路巡逻车辆在具有挑战性且不受约束条件下收集。部署了多视图推理(MVI)方法以增强模型预测性能。为开展分析,为每个车辆属性预测任务(具体为车型、车身形状和颜色)创建了包含 10 万 以上图像的数据集。模型在另一数据集上进行测试,该数据集包含 1809 个车牌号对应的 29,937 张图像。通过 varying 模型大小进行不同的实验组考察。分别实现了车型、车身形状、颜色和颜色二分类模型的最佳性能准确率分别为 93.70%、82.86%、85.19% 和 94.86%。得出结论,在此类复杂真实世界数据集中,必须使用 MVI 方法才能获得可用模型。我们的发现表明,YOLO-v11 和 YOLO-World 目标检测模型在车型和车身形状提取方面优于仅用于分类的模型。此外,较小的 YOLO 变体在性能上与较大版本相当,为实时预测提供了显著的效率优势。这项工作为在真实场景中提取车辆元数据提供了稳健的基准。这些模型可用于过滤和排序用户查询,最大限地缩短在大型车辆图像数据集中进行搜索所需的时间。

关键词

引用

@article{arxiv.2507.18966,
  title  = {YOLO for Knowledge Extraction from Vehicle Images: A Baseline Study},
  author = {Saraa Al-Saddik and Manna Elizabeth Philip and Ali Haidar},
  journal= {arXiv preprint arXiv:2507.18966},
  year   = {2025}
}