4Real-Video:学习通用的逼真 4D 视频扩散
计算机视觉与模式识别
2024-12-06 v1
摘要
我们提出 4Real-Video,一个用于生成 4D 视频的新框架。该视频以网格形式组织,包含时间轴和视角轴。在该网格中,同一行中的帧共享相同的时间步,而同一列中的帧来自相同的视角。我们提出了一种双流架构:一个流对列执行视角更新,另一个流对行执行时间更新。在每个扩散变换器层之后,一个同步层在两个标记流之间交换信息。我们提出了两种同步层的实现方式,分别采用硬同步或软同步。这种前馈架构在三个方面改进了前期工作:推理速度更快,视觉质量更高(以 FVD、CLIP 和 VideoScore 测量),以及在时间和视角上的一致性更好(以 VideoScore 和 Dust3R-Confidence 测量)。
引用
@article{arxiv.2412.04462,
title = {4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion},
author = {Chaoyang Wang and Peiye Zhuang and Tuan Duc Ngo and Willi Menapace and Aliaksandr Siarohin and Michael Vasilkovsky and Ivan Skorokhodov and Sergey Tulyakov and Peter Wonka and Hsin-Ying Lee},
journal= {arXiv preprint arXiv:2412.04462},
year = {2024}
}
备注
Project page: https://snap-research.github.io/4Real-Video/