中文

RAYNOVA:_ray 空间中的尺度-时序自回归世界建模

计算机视觉与模式识别 2026-02-26 v2

摘要

世界基础模型旨在以物理上合理的方式模拟现实世界的演化。不同于处理空间和时序相关性的现有方法,RAYNOVA提出一种基于相对Pl"ucker射线位置编码的几何无关性多视角世界模型,用于驾驶场景,采用双因果自回归框架。它在自回归过程中遵循尺度级和时序拓扑顺序,利用全局注意力进行统一的4D时空推理。与强制3D几何先验的现有工作不同,RAYNOVA基于相对Pl"ucker射线位置编码构建跨视图、帧和尺度的各向同性时空表示,实现对多样化摄像机设置和自机运动的稳健泛化。我们进一步引入循环训练范式以缓解长期视频生成中的分布漂移。RAYNOVA在nuScenes上实现了最先进的多视角视频生成结果,同时在多样化输入条件下提供更高的吞吐量和强大的可控性,无需显式3D场景表示即可泛化到新视角和摄像机配置。我们的代码将在https://raynova-ai.github.io/发布。

关键词

引用

@article{arxiv.2602.20685,
  title  = {RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space},
  author = {Yichen Xie and Chensheng Peng and Mazen Abdelfattah and Yihan Hu and Jiezhi Yang and Eric Higgins and Ryan Brigden and Masayoshi Tomizuka and Wei Zhan},
  journal= {arXiv preprint arXiv:2602.20685},
  year   = {2026}
}

备注

Accepted by CVPR 2026; Project website: https://raynova-ai.github.io/