基础设施导向的世界模型:桥接路侧感知的时间深度与空间宽度
计算机视觉与模式识别
2026-04-21 v1 机器人学
摘要
世界模型正在改变自动驾驶领域,但所有现有方法都采用车主视角,未探索基础设施视角。我们认为基础设施导向的世界模型提供了根本性的互补能力:拥有路侧系统独特优势的鸟瞰视角、多传感器持久视角。我们的核心论点是时空互补性:固定路侧传感器在时间深度上卓越,能够累积长期行为分布,包括罕见的安全关键事件;而车载传感器在空间宽度上卓越,能够在大型道路网络中采样多样化场景。本文提出了面向路侧感知的世界模型 (I-WM) 的愿景,分为三个阶段:(I) 带质量感知不确定性传播的生成场景理解;(II) 带多智能体反事实推理的物理信息预测动力学;(III) 通过潜在空间对齐的 V2X 通信协作式世界模型。我们提出了双层架构,注释无感知作为多模态数据引擎,为端到端生成世界模型提供动力,采用从 LiDAR 通过 4D 雷达和信号相位数据到事件相机的分阶段传感器策略。我们建立了驾驶世界模型范式的分类体系,定位 I-WM 相对于 LeCun 的 JEPA、Li Fei-Fei 的空间智能和 VLA 架构的相对位置,并引入面向基础设施的 VLA (I-VLA) 作为路侧感知、语言指令和交通控制动作的新型统一。我们的愿景基于现有的多 LiDAR 管道,为每个阶段提供开源基础,为通向理解和预测交通的基础设施之路提供了路径。
引用
@article{arxiv.2604.17651,
title = {Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception},
author = {Siyuan Meng and Chengbo Ai},
journal= {arXiv preprint arXiv:2604.17651},
year = {2026}
}
备注
18 pages, 7 tables, 1 figure, vision paper