STAGE:面向长时序驾驶场景模拟的流中心生成式世界模型
计算机视觉与模式识别
2025-09-03 v3
摘要
生成时间一致、高保真的长时序驾驶视频是自动驾驶世界建模中的一个基本挑战。现有方法通常由于时空动力学解耦不足和跨帧特征传播机制有限而遭受误差累积和特征错位。为解决这些局限性,我们提出了STAGE(流中心时序注意力生成引擎),一种新颖的自回归框架,它开创了分层特征协调和多阶段优化以实现可持续的视频生成。为实现高质量的长时序驾驶视频生成,我们引入了分层时序特征传递 (HTFT) 和一种新颖的多阶段训练策略。HTFT通过在视频生成过程中分别建模时序过程和去噪过程,并在帧之间传递去噪特征,从而增强视频帧之间的时间一致性。多阶段训练策略将训练分为三个阶段,通过模型解耦和自回归推理过程模拟,从而加速模型收敛并减少误差累积。在Nuscenes数据集上的实验表明,STAGE在长时序驾驶视频生成任务中显著超越了现有方法。此外,我们还探索了STAGE生成无限长度驾驶视频的能力。我们在Nuscenes数据集上生成了600帧的高质量驾驶视频,远超现有方法可实现的最大长度。
引用
@article{arxiv.2506.13138,
title = {STAGE: A Stream-Centric Generative World Model for Long-Horizon Driving-Scene Simulation},
author = {Jiamin Wang and Yichen Yao and Xiang Feng and Hang Wu and Yaming Wang and Qingqiu Huang and Yuexin Ma and Xinge Zhu},
journal= {arXiv preprint arXiv:2506.13138},
year = {2025}
}
备注
Accepted for 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)