中文

HazardNet:用于边缘设备实时交通安全检测的小型视觉语言模型

计算机视觉与模式识别 2025-03-03 v1 计算与语言

摘要

在当代城市环境中,随着车辆数量的增加和道路网络的复杂性,交通安全仍然是一个至关重要的问题。传统的安全关键事件检测系统主要依赖基于传感器的方法和传统机器学习算法,需要大量的数据收集和复杂的训练过程以遵守交通安全法规。本文介绍了 HazardNet,一种小型视觉语言模型(Vision Language Model),旨在通过利用先进语言和视觉模型的推理能力来增强交通安全。我们通过微调预训练的 Qwen2-VL-2B 模型构建了 HazardNet,该模型在开源替代方案中因性能优越且仅有二十亿参数的紧凑规模而被选中。这有助于在边缘设备上实现高效推理吞吐量的部署。此外,我们提出了 HazardQA,一个新颖的视觉问答(VQA)数据集,专门为在涉及安全关键事件的真实场景上训练 HazardNet 而构建。我们的实验结果表明,微调后的 HazardNet 在 F1-Score 上比基础模型最高提升了 89%,并且在某些情况下与 GPT-4o 等较大模型相比具有可比结果,提升最高可达 6%。这些进展突显了 HazardNet 在提供实时、可靠的交通安全事件检测方面的潜力,从而有助于减少事故并改善城市环境中的交通管理。HazardNet 模型和 HazardQA 数据集分别可在 https://huggingface.co/Tami3/HazardNet 和 https://huggingface.co/datasets/Tami3/HazardQA 获取。

关键词

引用

@article{arxiv.2502.20572,
  title  = {HazardNet: A Small-Scale Vision Language Model for Real-Time Traffic Safety Detection at Edge Devices},
  author = {Mohammad Abu Tami and Mohammed Elhenawy and Huthaifa I. Ashqar},
  journal= {arXiv preprint arXiv:2502.20572},
  year   = {2025}
}