中文

AVD2:面向事故视频描述的事故视频扩散

计算机视觉与模式识别 2025-03-05 v3

摘要

交通事故通常包含不可预测的场景,给自动驾驶系统的解释和响应带来复杂挑战。然而,现有方法由于缺乏针对事故场景的训练数据,难以阐明事故原因并提出预防措施。本文我们引入AVD2(Accident Video Diffusion for Accident Video Description),一种新型框架,通过生成与详细自然语言描述和推理相吻合的事故视频,增强事故场景理解,构建了贡献的EMM-AU(Enhanced Multi-Modal Accident Video Understanding)数据集。实证结果表明,集成EMM-AU数据集在自动评估指标和人类评估方面均实现了状态的最佳性能,显著推动了事故分析和预防领域的发展。项目资源可在 https://an-answer-tree.github.io 查阅。

关键词

引用

@article{arxiv.2502.14801,
  title  = {AVD2: Accident Video Diffusion for Accident Video Description},
  author = {Cheng Li and Keyuan Zhou and Tong Liu and Yu Wang and Mingqiao Zhuang and Huan-ang Gao and Bu Jin and Hao Zhao},
  journal= {arXiv preprint arXiv:2502.14801},
  year   = {2025}
}

备注

ICRA 2025, Project Page: https://an-answer-tree.github.io/