中文

通过解耦控制组合驾驶世界以生成对抗场景

计算机视觉与模式识别 2026-03-16 v1

摘要

自主驾驶的一个主要挑战是安全关键边缘案例的"长尾",这些案例通常源于常见交通元素的异常组合。合成这些场景至关重要,然而当前的可控生成模型提供不完整或纠缠的指导,阻止了对场景结构、对象身份和自车行为的独立操控。我们引入了CompoSIA,一个组合式驾驶视频模拟器,能够解耦这些交通因素,实现对多样化对抗驾驶场景的细粒度控制。为了支持场景元素的可控身份替换,我们提出了一种噪声级身份注入方法,允许在多样化的元素姿态下进行姿态无关的身份生成,全部来自单张参考图像。此外,引入了一种分层双分支行为控制机制以提升行为可控性。这种解耦控制实现了对抗场景的合成——系统地将安全元素组合成纠缠生成器无法产生的危险配置。广泛的对比实验表明,在可控生成质量上优于现有最先进基线,身份编辑的FVD提升17%,行为控制的旋转误差和平移误差分别降低30%和47%。此外,下游压力测试揭示了显著的规划器失败:在所有编辑模态下,3秒平均碰撞率增加了173%。

关键词

引用

@article{arxiv.2603.12864,
  title  = {Composing Driving Worlds through Disentangled Control for Adversarial Scenario Generation},
  author = {Yifan Zhan and Zhengqing Chen and Qingjie Wang and Zhuo He and Muyao Niu and Xiaoyang Guo and Wei Yin and Weiqiang Ren and Qian Zhang and Yinqiang Zheng},
  journal= {arXiv preprint arXiv:2603.12864},
  year   = {2026}
}