中文

Any-to-Bokeh:基于视频扩散模型的任意主体视频重聚焦

计算机视觉与模式识别 2025-10-13 v3 人工智能

摘要

扩散模型最近已成为相机仿真的强大工具,能够实现几何变换和真实的光学效果。其中,基于图像的散景渲染显示出了可喜的成果,但用于视频散景的扩散模型仍未被探索。现有的基于图像的方法受到时间闪烁和不一致模糊过渡的困扰,而当前的视频编辑方法缺乏对焦平面和散景强度的显式控制。这些问题限制了它们在可控视频散景中的适用性。在这项工作中,我们提出了一个单步扩散框架,用于生成时间连贯、深度感知的视频散景渲染。该框架采用适应焦平面的多平面图像(MPI)表示来对视频扩散模型进行条件化,从而使其能够利用来自预训练主干网络的强大 3D 先验。为了进一步增强时间稳定性、深度鲁棒性和细节保留,我们引入了渐进式训练策略。在合成和真实世界基准上的实验证明了其卓越的时间连贯性、空间准确性和可控性,超越了先前的基线方法。这项工作代表了首个用于视频散景生成的专用扩散框架,为时间连贯且可控的景深效果建立了新的基线。

关键词

引用

@article{arxiv.2505.21593,
  title  = {Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model},
  author = {Yang Yang and Siming Zheng and Qirui Yang and Jinwei Chen and Boxi Wu and Xiaofei He and Deng Cai and Bo Li and Peng-Tao Jiang},
  journal= {arXiv preprint arXiv:2505.21593},
  year   = {2025}
}

备注

project page: https://vivocameraresearch.github.io/any2bokeh/