中文

面向自动驾驶安全的零样本新型危险物体检测的多智能体视觉语言系统

计算机视觉与模式识别 2025-04-21 v1 人工智能

摘要

检测视觉数据中的异常危险物,特别是视频流中的不可预测的超标签危险物,是自动驾驶中的关键挑战。现有模型往往难以处理依赖预定义物体类别的不可预测、超标签危险物。在本文中,我们提出一种多模态方法,将视觉语言推理与零样本目标检测集成,以提高危险物识别和解释能力。我们的管道包括一个视觉语言模型(VLM)和一个大语言模型(LLM),用于检测交通场景中的危险物。我们通过纳入OpenAI的CLIP模型来匹配预测的危险物与边界框注释,从而提高局部化精度。为评估模型性能,我们通过去噪和扩展基础COOOL(Challenge-of-Out-of-Label)异常检测基准数据集,创建了包含完整自然语言描述的危险物注释的ground truth数据集。我们定义了一种危险物检测和标签评估方法,基于余弦相似度。该评估考虑了预测危险物描述与每个视频的注释ground truth之间的语义相似性。此外,我们发布了一套工具,用于结构化和管理大规模危险物检测数据集。我们的发现概述了当前基于视觉语言的方法的优势和局限性,为改进自动驾驶危险物检测系统提供了洞见。我们的模型、脚本和数据可在 https://github.com/mi3labucm/COOOLER.git 查阅。

关键词

引用

@article{arxiv.2504.13399,
  title  = {Towards a Multi-Agent Vision-Language System for Zero-Shot Novel Hazardous Object Detection for Autonomous Driving Safety},
  author = {Shashank Shriram and Srinivasa Perisetla and Aryan Keskar and Harsha Krishnaswamy and Tonko Emil Westerhof Bossen and Andreas Møgelmose and Ross Greer},
  journal= {arXiv preprint arXiv:2504.13399},
  year   = {2025}
}