4Real-Video-V2:用于 4D 场景生成的融合视角-时间注意力与前馈重构
计算机视觉与模式识别
2025-06-24 v1
摘要
我们提出首个能够使用前馈架构计算每个时间步的视频帧和 3D 高斯粒子 4D 时空网格的框架。我们的架构包含两个主要组件:4D 视频模型和 4D 重建模型。在第一部分,我们分析当前在两流设计中顺序或并行执行空间和时间注意力的 4D 视频扩散架构。我们指出现有方法的局限性,并引入一种在单层内执行空间和时间注意力的新颖融合架构。我们的方法的关键在于稀疏注意力模式,即令 token 注意力于同一帧内的其他 token、同一时间戳内的其他 token 或同一视角的其他 token。在第二部分,我们通过引入高斯头部、相机 token 替换算法以及额外的动态层和训练,将现有的 3D 重建算法扩展开来。总体而言,我们在 4D 生成方面建立了新的状态,提高了视觉质量和重建能力。
引用
@article{arxiv.2506.18839,
title = {4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation},
author = {Chaoyang Wang and Ashkan Mirzaei and Vidit Goel and Willi Menapace and Aliaksandr Siarohin and Avalon Vinella and Michael Vasilkovsky and Ivan Skorokhodov and Vladislav Shakhrai and Sergey Korolev and Sergey Tulyakov and Peter Wonka},
journal= {arXiv preprint arXiv:2506.18839},
year = {2025}
}