中文

用于驾驶行为分析的多帧视觉-语言模型长程推理

计算与语言 2024-08-06 v1 计算机视觉与模式识别

摘要

在现实情境中识别危险驾驶行为对于司机和行人安全至关重要。然而,将自然语言模型集成到该领域仍相对未被充分利用。为此,我们创建了一个新型多模态指令调优数据集和司机教练推断系统。我们的主要用例是基于 Dashcam 的商业司机教练。北美 Dashcam 市场预计从2022到2027年年复合年增长率为15.4%。我们的数据集使语言模型能够学习各种危险驾驶情景中的视觉指令,强调对有效司机教练和管理层理解至关重要的详细推理。我们的模型在车内面向道路和面向司机的RGB摄像头录像上进行训练,捕捉车辆配备 Dashcam 时驾驶行为的全面范围。

关键词

引用

@article{arxiv.2408.01682,
  title  = {Multi-Frame Vision-Language Model for Long-form Reasoning in Driver Behavior Analysis},
  author = {Hiroshi Takato and Hiroshi Tsutsui and Komei Soda and Hidetaka Kamigaito},
  journal= {arXiv preprint arXiv:2408.01682},
  year   = {2024}
}

备注

On-going work