中文

使用多模态大语言模型从热成像图像中检测目标:交通应用

计算机视觉与模式识别 2024-06-21 v1 计算与语言 计算机与社会

摘要

将热成像数据与多模态大语言模型(MLLM)集成构成了提高自动驾驶系统和众多智能交通系统(ITS)应用安全性和功能性的激动人心的机会。本研究探讨了 MLLM 是否能够理解来自 RGB 和热成像摄像机的复杂图像并直接检测目标。我们的目标包括:1) 评估 MLLM 从各种数据集中学习的能力,2) 检测热成像摄像机中的目标并识别元素,3) 确定两个独立的模态图像是否显示相同的场景,以及 4) 使用不同模式学习所有目标。研究结果显示,GPT-4 和 Gemini 在检测和分类热成像图像方面都表现良好。此外,行人分类的平均绝对百分比误差(MAPE)分别为 70.39% 和 81.48%。而自行车、汽车和摩托车检测的 MAPE 分别为 78.4%、55.81% 和 96.15%。Gemini 的 MAPE 分别为 66.53%、59.35% 和 78.18%。这一发现进一步表明 MLLM 能够识别热成像图像,可用于 ITS 应用的先进成像自动化技术。

关键词

引用

@article{arxiv.2406.13898,
  title  = {The Use of Multimodal Large Language Models to Detect Objects from Thermal Images: Transportation Applications},
  author = {Huthaifa I. Ashqar and Taqwa I. Alhadidi and Mohammed Elhenawy and Nour O. Khanfar},
  journal= {arXiv preprint arXiv:2406.13898},
  year   = {2024}
}