中文

VLM 作为策略者:通过引导扩散生成安全关键测试情景

机器人学 2025-12-03 v1 机器学习

摘要

自动驾驶系统 (ADAS) 的安全部署依赖于全面测试与评估。然而,能够有效暴露系统漏洞的安全关键情景在现实世界中极稀缺。现有情景生成方法面临在确保保真性、关键性和互动性的同时,缺乏对被测车辆 (VUT) 实时动态响应能力。为此,本文提出一种安全关键测试情景生成框架,将视觉语言模型 (VLM) 的高层语义理解能力与自适应引导扩散模型的细粒度生成能力相结合。该框架建立三层层次化架构:由 VLM 驱动的策略层用于确定情景生成目标,引导功能 formulation 的战术层,以及引导扩散执行的运营层。我们首先建立高质量的基础扩散模型,学习真实驾驶情景的数据分布。随后,我们设计自适应引导扩散方法,实现对背景车辆 (BV) 的实时、精确控制。最后,将 VLM 融入,通过深度情景理解和风险推理自动生成情景生成目标和引导函数,最终引导扩散模型实现 VLM 导向的情景生成。实验结果表明,所提方法可高效生成真实、多样且高度互动的安全关键测试情景。案例研究进一步验证了所提方法的适应性和 VLM 导向生成性能。

关键词

引用

@article{arxiv.2512.02844,
  title  = {VLM as Strategist: Adaptive Generation of Safety-critical Testing Scenarios via Guided Diffusion},
  author = {Xinzheng Wu and Junyi Chen and Naiting Zhong and Yong Shen},
  journal= {arXiv preprint arXiv:2512.02844},
  year   = {2025}
}

备注

25 pages, 9 figures