中文

AnyView:合成动态场景中的任意新视角

计算机视觉与模式识别 2026-01-26 v1 机器学习 机器人学

摘要

现代生成式视频模型在生成令人信服的高质量输出方面表现出色,但在高度动态的真实世界环境中难以维持多视角和时空一致性。本文引入 \textbf{AnyView},一个基于扩散的视频生成框架,用于 \emph{动态视角合成},并采用最小的归纳偏置或几何假设。我们利用多种数据源(包括单目 (2D)、多视角静态 (3D) 和多视角动态 (4D) 数据集)进行训练,构建通用的时空隐式表示,能够从任意摄像机位置和轨迹生成零样本新视频。我们在标准基准测试上评估了 AnyView,显示与当前最先进方法相当,并提出 \textbf{AnyViewBench},一个致力于 \emph{极端} 动态视角合成的新型挑战性基准,涵盖多样化真实场景。在更具挑战性的环境中,我们发现大多数基线方法性能大幅下降,因为它们需要视点间显著重叠,而 AnyView 能够在从 \emph{任意} 视角生成真实、合理且时空一致的视频。结果、数据、代码和模型可在:https://tri-ml.github.io/AnyView/ 查看。

关键词

引用

@article{arxiv.2601.16982,
  title  = {AnyView: Synthesizing Any Novel View in Dynamic Scenes},
  author = {Basile Van Hoorick and Dian Chen and Shun Iwase and Pavel Tokmakov and Muhammad Zubair Irshad and Igor Vasiljevic and Swati Gupta and Fangzhou Cheng and Sergey Zakharov and Vitor Campagnolo Guizilini},
  journal= {arXiv preprint arXiv:2601.16982},
  year   = {2026}
}

备注

Project webpage: https://tri-ml.github.io/AnyView/