DissolveStereo:用于零样 stereo 视频生成的粗糙深度注入
计算机视觉与模式识别
2026-05-05 v3
摘要
生成高质量的立体视频需要在帧之间保持一致的深度感知和时间一致性。尽管图像和视频合成使用扩散模型取得了进展,但仍然具有保持左视图和右视图之间一致性挑战。我们引入DissolveStereo,一个无需配对训练数据的零样立体视频生成框架,利用视频扩散先验。我们的关键创新包括用于初始化立体感知潜在表示的噪声重启策略,以及逐步调和潜在空间的迭代细化过程,以解决时间闪烁和视图不一致性问题。重要的是,我们提出使用溶解深度图以简化潜在空间操作,通过降低高频深度信息。我们的全面评估包括定量指标和用户研究,表明DissolveStereo生成的高质量立体视频具有增强的深度一致性和时间平滑度。就尺度不一致性而言,我们的方法在MEt3R得分上比当前最先进技术提高了11.7%。此外,用户研究显示,我们的方法在感知帧质量上高出8.0%,在感知时间一致性上高出10.9%。我们的代码可在https://github.com/shijianjian/DissolveStereo获取。
引用
@article{arxiv.2411.14295,
title = {DissolveStereo: Coarse Depth Injection for Zero-Shot Stereo Video Generation},
author = {Jian Shi and Qian Wang and Zhenyu Li and Wenqing Cui and Ramzi Idoughi and Peter Wonka},
journal= {arXiv preprint arXiv:2411.14295},
year = {2026}
}