X-World:面向可扩展端到端驾驶的可控 ego-centric 多摄像头世界模型
计算机视觉与模式识别
2026-04-01 v2 人工智能
摘要
在自动驾驶的端到端时代,视觉-语言-动作 (VLA) 策略直接将原始传感器流映射到驾驶动作,对可扩展和可靠的评估需求日益增长。然而,当前的评估管道仍严重依赖真实世界路测,这既昂贵又难以覆盖有限的场景,且难以复现。这些挑战催生了需要能够在提出的动作下生成逼真未来观察的真实世界模拟器,同时保持可控性和稳定性,以适应长期时间范围。我们提出 X-World,一种基于动作的多摄像头生成式世界模型,直接在视频空间中模拟未来观察。给定同步的多视图摄像头历史记录和未来动作序列,X-World 生成遵循命令动作的未来多摄像头视频流。为确保可重复且可编辑的场景滚动,X-World 还支持对动态交通代理和静态道路元素的可选控制,同时保留基于文本提示的界面以实现外观层面的控制(例如天气和白天/夜晚)。除了世界模拟,X-World 还能通过以外观提示为条件,进行视频风格迁移,同时保持 underlying action 和场景动力学。X-World 的核心是设计用于显式鼓励跨视图几何一致性和在多样控制信号下保持时间一致性的多视图潜在视频生成器。实验表明,X-World 实现了高质量的多视图视频生成,具有 (i) 跨摄像机强大的视图一致性,(ii) 长时间滚动的稳定动态,以及 (iii) 严格动作跟随和忠实遵守可选场景控制的高可控性。这些特性使 X-World 成为可扩展且可复现评估的实用基础。
引用
@article{arxiv.2603.19979,
title = {X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving},
author = {Chaoda Zheng and Sean Li and Jinhao Deng and Zhennan Wang and Shijia Chen and Liqiang Xiao and Ziheng Chi and Hongbin Lin and Kangjie Chen and Boyang Wang and Yu Zhang and Xianming Liu},
journal= {arXiv preprint arXiv:2603.19979},
year = {2026}
}
备注
Technical Report