中文

AI 生成驾驶视频是否适用于自动驾驶:诊断性评估框架

计算机视觉与模式识别 2025-12-09 v1

摘要

最近的文本到视频模型已实现从自然语言提示生成高分辨率驾驶场景的能力。这些 AI 生成驾驶视频(AIGVs)为自动驾驶(AD)提供了低成本、可扩展的替代方案,作为真实或模拟数据的替代选项。但一个关键问题仍悬置:这些视频能否可靠地支持 AD 模型的训练和评估?我们提出了诊断框架,系统性地研究此问题。首先,我们引入常见 AIGV 失效模式分类,包括视觉瑕疵、物理上不合理的运动以及交通语义违规,并展示其对目标检测、跟踪和实例分割的负面影响。为支持此分析,我们构建了 ADGV-Bench,一个聚焦驾驶的基准,包含人工质量标注及多个感知任务的密集标签。随后,我们提出 ADGVE,一种结合静态语义、时序线索、车道遵循信号以及视觉语言模型(VLM)引导推理的驾驶专用评估器,为每个片段生成综合质量分数。实验表明,盲目添加原始 AIGVs 可能降低感知性能,而通过 ADGVE 筛选后可显著提升视频质量评估指标及下游 AD 模型性能,使 AIGVs 成为真实数据之受益的补充。我们的研究既揭示了 AIGVs 的风险与潜力,也为未来 AD 流程中安全利用大规模视频生成提供了实用工具。

关键词

引用

@article{arxiv.2512.06376,
  title  = {Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework},
  author = {Xinhao Xiang and Abhijeet Rastogi and Jiawei Zhang},
  journal= {arXiv preprint arXiv:2512.06376},
  year   = {2025}
}