DynamicScaler:用于全景场景的无缝且可扩展视频生成
计算机视觉与模式识别
2025-10-07 v2
摘要
沉浸式 AR/VR 应用和空间智能的日益增长的需求,提高了生成高质量场景级和 360 全景视频的需求。然而,大多数视频扩散模型受限于分辨率和宽高比,这限制了其在场景级动态内容合成中的适用性。本文提出了 ,以实现保持全景场景任意大小下一致性的空间可扩展和全景动态场景合成。具体而言,我们引入了偏移位移去噪器(Offset Shifting Denoiser),通过一种具有固定分辨率的扩散模型实现对全景动态场景的高效、同步和连贯去噪,借助一种无缝旋转窗口,确保边界过渡无缝且在整个全景空间内保持一致,从而容纳不同分辨率和宽高比。此外,我们采用全局运动引导机制(Global Motion Guidance mechanism),确保局部细节保真度和全局运动连续性。广泛的实验表明,我们的方法在全景场景级视频生成中实现了卓越的内容和运动质量,提供了一个训练无需、高效且可扩展的解决方案,可实现输出视频分辨率不变的 VRAM 消耗。项目页面可在 访问。
引用
@article{arxiv.2412.11100,
title = {DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes},
author = {Jinxiu Liu and Shaoheng Lin and Yinxiao Li and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2412.11100},
year = {2025}
}
备注
CVPR 2025