中文

基于后场景预测的多模态驾驶场景生成

计算机视觉与模式识别 2025-03-27 v2

摘要

自动驾驶中的生成模型促进了多样化场景创建,但现有方法不足之处在于仅捕获有限的模态范围,限制了为全面评估自动驾驶系统而生成可控场景的能力。本文引入一种多模态生成框架,包含四种主要数据模态,其中新增了地图模态。通过对模态进行分词化处理,本文的场景序列生成框架以自回归方式预测每个场景,同时通过两阶段方法管理计算需求。Temporal AutoRegressive (TAR) 组件捕获每个模态的帧间动态,而Ordered AutoRegressive (OAR) 组件通过按固定顺序顺序预测标记来在每个场景内对齐模态。为维持地图与自车动作模态之间的一致性,本文引入Action-aware Map Alignment (AMA) 模块,该模块基于自车动作应用变换以维持这些模态之间的一致性。本文框架有效生成复杂且真实的驾驶场景,确保多模态一致性,并对场景元素提供细粒度控制。项目页面:https://yanhaowu.github.io/UMGen/

关键词

引用

@article{arxiv.2503.14945,
  title  = {Generating Multimodal Driving Scenes via Next-Scene Prediction},
  author = {Yanhao Wu and Haoyang Zhang and Tianwei Lin and Lichao Huang and Shujie Luo and Rui Wu and Congpei Qiu and Wei Ke and Tong Zhang},
  journal= {arXiv preprint arXiv:2503.14945},
  year   = {2025}
}

备注

CVPR 2025