中文

使用多模态大语言模型进行交通安全关键事件自动检测

计算机视觉与模式识别 2024-06-21 v1 计算机与社会

摘要

传统的自动驾驶系统中安全事件分析方法依赖复杂的机器学习模型和大量数据以实现高精度和可靠性。然而,多模态大语言模型(MLLM)的出现提供了一种新方法,通过整合文本、视觉和音频多种模式,提供对驾驶视频的自动化分析。我们的框架利用 MLLM 的推理能力,通过特定情境的提示确保对危险事件检测提供准确、可靠且可操作的见解。通过采用 Gemini-Pro-Vision 1.5 和 Llava 等模型,我们的方法旨在自动化安全关键事件,并缓解 MLLM 输出常见问题,如幻觉。初步结果表明,该框架在零样本学习和准确情境分析方面具有潜力,尽管需要在更大数据集上进一步验证。此外,还需要进一步调查通过少量样本学习和微调模型来增强该框架性能的方法。该研究凸显了 MLLM 在提高自然驾驶视频中安全关键事件检测和理解复杂环境中的作用。

关键词

引用

@article{arxiv.2406.13894,
  title  = {Using Multimodal Large Language Models for Automated Detection of Traffic Safety Critical Events},
  author = {Mohammad Abu Tami and Huthaifa I. Ashqar and Mohammed Elhenawy},
  journal= {arXiv preprint arXiv:2406.13894},
  year   = {2024}
}