基于溯因的第一视角事故视频理解用于安全驾驶感知
计算机视觉与模式识别
2024-03-04 v1 人工智能
摘要
我们提出了 MM-AU,一个用于多模态事故视频理解的新数据集。MM-AU 包含 11,727 个野生环境下的第一视角事故视频,每个视频均配有时间对齐的文本描述。我们标注了超过 223 万个物体框和 58,650 对基于视频的事故原因,涵盖 58 种事故类别。MM-AU 支持各种事故理解任务,特别是多模态视频扩散,以理解安全驾驶的因果链。利用 MM-AU,我们提出了一个用于安全驾驶感知的溯因事故视频理解框架(AdVersa-SD)。AdVersa-SD 通过一种由溯因 CLIP 模型驱动的以物体为中心的视频扩散(OAVD)方法执行视频扩散。该模型涉及对比交互损失,以学习正常、近事故、事故帧与相应文本描述(如事故原因、预防建议和事故类别)的成对共现。OAVD 在视频生成中固定原始帧背景内容的同时强制执行因果区域学习,以找出特定事故的主导因果链。大量实验验证了 AdVersa-SD 的溯因能力以及 OAVD 相对于最先进扩散模型的优越性。此外,由于 AdVersa-SD 依赖于精确的物体和事故原因信息,我们提供了针对物体检测和事故原因回答的仔细基准评估。
引用
@article{arxiv.2403.00436,
title = {Abductive Ego-View Accident Video Understanding for Safe Driving Perception},
author = {Jianwu Fang and Lei-lei Li and Junfei Zhou and Junbin Xiao and Hongkai Yu and Chen Lv and Jianru Xue and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2403.00436},
year = {2024}
}
备注
Accepted by CVPR2024. This is not the camera-ready version. The Project page: http://www.lotvsmmau.net