OmniView:面向 3D 和 4D 视图合成的全知扩散模型
计算机视觉与模式识别
2026-01-26 v2 人工智能
摘要
此前将相机控制注入扩散模型的方法专注于 4D 一致性任务的特定子集:新颖视图合成、带有相机控制的文本到视频、图像到视频等。因此,这些碎片化的方法在可用的 3D/4D 数据的不相交切片上进行训练。我们提出了 OmniView,一个跨广泛 4D 一致性任务的统一框架。我们的方法分别表示空间、时间和视图条件,使这些输入的灵活组合成为可能。例如,OmniView 可以从静态、动态和多视图输入中合成新颖视图,在时间上前后外推轨迹,并创建具有完整相机控制的文本或图像提示视频。OmniView 在多样化基准和指标上与任务特定模型具有竞争力,在多视图 NVS LLFF 数据集中将图像质量分数提高最多 33%,在动态 NVS Neural 3D Video 基准上提高 60%,在 RE-10K 静态相机控制上提高 20%,并在文本条件视频生成中将相机轨迹误差减少 4 倍。凭借强大的通用性,OmniView 展示了一个通用 4D 视频模型的可行性。项目页面位于 https://snap-research.github.io/OmniView/
引用
@article{arxiv.2512.10940,
title = {OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis},
author = {Xiang Fan and Sharath Girish and Vivek Ramanujan and Chaoyang Wang and Ashkan Mirzaei and Petr Sushko and Aliaksandr Siarohin and Sergey Tulyakov and Ranjay Krishna},
journal= {arXiv preprint arXiv:2512.10940},
year = {2026}
}
备注
Project page: https://snap-research.github.io/OmniView/