PanoWorld:几何一致的全景视频世界建模
计算机视觉与模式识别
2026-05-18 v1 人工智能
摘要
我们提出PanoWorld,一种从单张图像和说明文字生成几何一致360°全景视频的全景视频世界模型。现有全景视频方法主要优化视觉逼真,未对底层3D场景状态进行显式约束,导致输出在深度、对应关系和球面上的运动一致性差。我们通过将全景视频生成建模为几何和动态一致的潜在状态建模问题,而非纯视觉合成,来弥合这一差距。基于预训练的视角视频世界模型,我们引入两种轻量级正则化器:一种针对伪地面真实全景深度的深度一致性损失,以及一种监督跟踪点在时间轴上3D世界坐标轨迹一致性的轨迹一致性损失。我们还应用了球面几何感知的条件和位置编码适应。此外,我们引入PanoGeo,一个统一的几何感知全景视频数据集,包含一致的深度、轨迹和提示标注,来源于多样化的真实和合成数据,用于训练和分层评估。实验表明,PanoWorld在保持具竞争力视觉逼真度的同时,显著提升了几何一致性,确立了全景视频生成必须视为几何建模问题,以支持具身AI应用中整体空间理解需求。代码已公开于https://github.com/ostadabbas/PanoWorld。
引用
@article{arxiv.2605.15391,
title = {PanoWorld: Geometry-Consistent Panoramic Video World Modeling},
author = {Le Jiang and Xiangyu Bai and Bishoy Galoaa and Shayda Moezzi and Caleb James Lee and Tooba Imtiaz and Edmund Yeh and Jennifer Dy and Yanzhi Wang and Sarah Ostadabbas},
journal= {arXiv preprint arXiv:2605.15391},
year = {2026}
}