中文

CrashChat:用于多任务交通事故视频分析的多模态大语言模型

计算机视觉与模式识别 2025-12-23 v1 人工智能

摘要

自动化事故视频分析对于利用不断增长的驾驶视频数据进行交通安全研究和自主驾驶中的责任归属至关重要。事故视频分析是一个具有挑战性的多任务问题,因为 crash 事件在视频数据中的复杂时空动力学以及多样化的分析需求使得该问题变得复杂。它需要涵盖事故识别、时序锚定和高级视频理解等能力。现有模型无法在统一框架内完成所有这些任务,针对此类模型的有效训练策略也鲜有探索。为填补这一空白,本文提出了 CrashChat,一种基于 VideoLLaMA3 构建的用于多任务交通事故分析的多模态大语言模型(MLLM)。CrashChat 通过指令微调获取领域特定知识,并采用一种基于任务解耦和分组的新型多任务学习策略,该策略在任务组内部以及跨任务组之间最大化联合学习的收益,同时减轻负迁移。在综合的公开数据集上的数值实验表明,CrashChat 在各种模型规模和传统视觉方法上均表现出色,实现了最佳性能。它在事故识别上接近完美准确率,在事故局部化上实现了 176% 的改进,在更具挑战性的事前局部化上实现了 40% 的改进。相较于通用 MLLM,CrashChat 在事故描述和推理任务中显著提升了文本准确性和内容覆盖度,BLEU 分数提升了 0.18-0.41 分,ROUGE 分数提升了 0.18-0.42 分。除了卓越的性能之外,CrashChat 是一个便于实际部署的便捷、端到端的分析工具。CrashChat 的数据集和实现代码已 disponible at https://github.com/Liangkd/CrashChat。

关键词

引用

@article{arxiv.2512.18878,
  title  = {CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis},
  author = {Kaidi Liang and Ke Li and Xianbiao Hu and Ruwen Qin},
  journal= {arXiv preprint arXiv:2512.18878},
  year   = {2025}
}