因果实体反射的自我中心交通事故事故视频合成
计算机视觉与模式识别
2025-07-01 v1
摘要
从自我中心视角理解车祸的因果对于自动驾驶汽车的安全至关重要,而合成反映因果实体的交通事故视频可以促进对现实中无法负担的事故做出响应的能力测试。然而,将真实世界视频中看到的因果关系融入合成视频仍然具有挑战性。这项工作认为,精确识别事故参与者并捕捉其相关行为至关重要。为此,我们提出了一种新颖的扩散模型Causal-VidSyn,用于合成自我中心的交通事故视频。为了在视频扩散中实现因果实体定位,Causal-VidSyn利用原因描述和驾驶员注视点来识别事故参与者和行为,并辅以事故原因回答和注视条件选择模块。为了支持Causal-VidSyn,我们进一步构建了Drive-Gaze,这是驾驶事故场景中最大的驾驶员注视数据集(包含154万帧注视点)。大量实验表明,在各种任务中,包括事故视频编辑、正常到事故视频扩散和文本到视频生成,Causal-VidSyn在帧质量和因果敏感性方面均超越了最先进的视频扩散模型。
引用
@article{arxiv.2506.23263,
title = {Causal-Entity Reflected Egocentric Traffic Accident Video Synthesis},
author = {Lei-lei Li and Jianwu Fang and Junbin Xiao and Shanmin Pang and Hongkai Yu and Chen Lv and Jianru Xue and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2506.23263},
year = {2025}
}
备注
Accepted by ICCV2025