ScenarioControl:基于视觉语言可控的向量化潜在场景生成
计算机视觉与模式识别
2026-04-21 v1 机器人学
摘要
我们介绍 ScenarioControl,这是首个用于学习驾驶情景生成的视觉语言控制机制。给定文本提示或输入图像,Scenario-Control 会合成多样化、真实的 3D 情景滚动,包括地图、随时间变化的 3D 盒构成的反应性行驶者、行人、驾驶基础设施以及 ego 摄像机观察。该方法在代表道路结构和动态代理人的向量化潜在空间中生成场景。为将多模态控制与稀疏向量化场景元素连接起来,我们提出了一种跨全局控制机制,将跨注意力与轻量级全局上下文分支集成,实现对道路布局和交通条件的细粒度控制,同时保持真实性。该方法会从场景中不同代理人的视角生成一致的时序情景滚动,支持驾驶情景的长期延续。为便于训练和评估,我们发布了一个与向量化地图结构对齐的文本注释数据集。广泛的实验表明,ScenarioControl 在所有实验中,控制遵循性和忠实度均优于所测试的所有方法。项目网页:https://light.princeton.edu/ScenarioControl
引用
@article{arxiv.2604.17147,
title = {ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation},
author = {Lili Gao and Yanbo Xu and William Koch and Samuele Ruffino and Luke Rowe and Behdad Chalaki and Dmitriy Rivkin and Julian Ost and Roger Girgis and Mario Bijelic and Felix Heide},
journal= {arXiv preprint arXiv:2604.17147},
year = {2026}
}