面向驾驶场景生成的风险可控多视图扩散
计算机视觉与模式识别
2026-03-13 v1
摘要
生成安全关键驾驶情景对于评估和改进自动驾驶系统至关重要,但长尾有风险情形在真实世界数据中罕见,难以通过手动情景设计加以指定。现有生成方法通常将风险作为事后标签处理,难以在多视图驾驶场景中保持几何一致性。我们提出了 RiskMV-DPO,一个面向物理信息驱动、风险可控的多视图情景生成通用且系统化的管道。通过将目标风险水平与物理驱动的风险建模相结合,我们自主合成多样且高风险的动态轨迹,用作基于扩散的视频生成器的显式几何锚点。为确保时空一致性和几何保真度,我们引入几何-外观对齐模块和基于运动感知掩码的区域感知直接偏好优化 (RA-DPO) 策略,以聚焦学习于局部动态区域。实验在 nuScenes 数据集上表明,RiskMV-DPO 可在保持领先视觉质量的同时,自由生成广泛多样的长尾情景,3D 检测 mAP 从 18.17 提升至 30.50,FID 降至 15.70。我们的工作将世界模型的角色从被动的环境预测转向主动、风险可控的合成,为面向安全导向的具身智能开发提供可扩展的工具链。
引用
@article{arxiv.2603.11534,
title = {Risk-Controllable Multi-View Diffusion for Driving Scenario Generation},
author = {Hongyi Lin and Wenxiu Shi and Heye Huang and Dingyi Zhuang and Song Zhang and Yang Liu and Xiaobo Qu and Jinhua Zhao},
journal= {arXiv preprint arXiv:2603.11534},
year = {2026}
}