中文

多模态大语言模型在交通物体检测中的进展:综合综述与实证测试

计算机视觉与模式识别 2024-09-30 v1 人工智能 计算与语言

摘要

本研究旨在全面综述和实证评估多模态大语言模型(MLLMs)和大型视觉模型(VLMs)在交通系统中物体检测中的应用。第一部分,我们提供关于 MLLMs 在交通应用中潜在益处的背景,并综述了前期研究中的当前 MLLM 技术。我们强调了其在 various transportation scenarios 中在物体检测中的有效性和局限性。第二部分涉及提供关于交通应用中端到端物体检测的分类学概览及未来方向。基于此,我们提出了对 MLLMs 在三个真实世界交通问题上的经验分析,这些问题包括道路安全属性提取、危险事件检测和热成像图像的视觉推理。我们的发现提供了对 MLLM 性能的详细评估,揭示了其优势和改进空间。最后,我们讨论了 MLLMs 在提升交通物体检测方面的实际局限性和挑战,从而为该关键领域的未来研究和开发提供了路线图。

关键词

引用

@article{arxiv.2409.18286,
  title  = {Advancing Object Detection in Transportation with Multimodal Large Language Models (MLLMs): A Comprehensive Review and Empirical Testing},
  author = {Huthaifa I. Ashqar and Ahmed Jaber and Taqwa I. Alhadidi and Mohammed Elhenawy},
  journal= {arXiv preprint arXiv:2409.18286},
  year   = {2024}
}