中文

面向交通标志检测的人类在回路推理——YOLO与Video-LLava协作方法

计算机视觉与模式识别 2025-05-23 v2

摘要

交通标志识别(TSR)检测是自动驾驶车辆的关键组件。虽然You Only Look Once(YOLO)是流行的实时目标检测算法,但训练数据质量和恶劣天气条件(如暴雨)等因素可能导致检测失败。在视觉相似性对象存在时,这类失败尤其危险,例如误将30 km/h标志识别为更高限速标志。本文提出一种方法,结合视频分析与推理,利用人类在回路引导大型视觉模型以提高YOLO在半真实环境下检测道路限速标志的准确性。我们假设,Video-LLava的引导式提示与推理能力可增强YOLO的交通标志检测性能。该假设通过在CARLA车辆仿真器录制的视频数据集上进行的人工标注准确度评估得到支持。结果表明,结合YOLO与Video-LLava及推理的协作方法,能有效应对暴雨和阴天等恶劣条件,这些条件会阻碍YOLO的检测能力。

关键词

引用

@article{arxiv.2410.05096,
  title  = {Human-in-the-loop Reasoning For Traffic Sign Detection: Collaborative Approach Yolo With Video-llava},
  author = {Mehdi Azarafza and Fatima Idrees and Ali Ehteshami Bejnordi and Charles Steinmetz and Stefan Henkler and Achim Rettberg},
  journal= {arXiv preprint arXiv:2410.05096},
  year   = {2025}
}

备注

10 pages, 6 figures