基于视觉语言模型的多视角相位感知行人-车辆事故推理框架
计算机视觉与模式识别
2025-11-19 v1 人工智能
摘要
行人-车辆事故仍是城市安全的关键挑战,其中行人死亡占全球交通事故总数的20%以上。虽然现有的基于视频的系统可以检测事故何时发生,但提供的洞察有限,无法洞察这些事件如何在行人行为的不同认知阶段中展开。最近的视觉语言模型(VLM)在视频理解方面表现出强大的潜力,但它们通常以孤立方式处理视频,缺乏显式的时间结构或多视角集成。本文引入了多视角相位感知行人-车辆事故推理框架(Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning, MP-PVIR),该框架通过四个阶段系统性地处理多视角视频流,生成结构化诊断报告:(1)事件触发的多视角视频获取,(2)行人行为阶段分段,(3)阶段特定的多视角推理,(4)层次化综合与诊断推理。该框架通过自动将事故分割为认知阶段、在每个阶段内进行同步的多视角分析,并综合结果以因果链形式,生成具有针对性的预防策略。特别地,两个专门的VLM支撑MP-PVIR管道:TG-VLM用于行为阶段分段(mIoU = 0.4881),PhaVR-VLM用于阶段感知的多视角分析,实现了33.063的captioning分数和最高可达64.70%的问答准确率。最后,一个指定的大型语言模型用于生成详细的报告,包括场景理解、行为解释、因果推理和预防建议。评估在Woven Traffic Safety数据集上显示,MP-PVIR有效地将多视角视频数据转化为可操作的见解,推动了面向车辆-基础设施协同系统的AI驱动交通安全分析。
引用
@article{arxiv.2511.14120,
title = {Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models},
author = {Hao Zhen and Yunxiang Yang and Jidong J. Yang},
journal= {arXiv preprint arXiv:2511.14120},
year = {2025}
}
备注
23 pages, 4 figures, 3 tables