中文

使用视频扩散模型进行后期聚焦学习

计算机视觉与模式识别 2025-12-30 v3

摘要

聚焦是摄影的基石,但自动对焦系统往往无法捕获预期的主体,用户常希望在拍摄后调整焦点。我们引入一种新方法,通过视频扩散模型实现真实的后期聚焦。从单张非聚焦图像,我们的方法生成感知上准确的焦点栈,表示为视频序列,从而实现交互式聚焦并解锁一系列下游应用。我们发布了一个在多种真实智能手机条件下获取的大规模焦点栈数据集,以支持此工作及未来研究。我们的方法在感知质量和鲁棒性方面 consistently 优于现有方法,无论是在何种具有挑战性的场景下,都能实现更先进的焦点编辑功能,为日常摄影开辟了更广阔的应用前景。代码和数据可在 www.learn2refocus.github.io 获取。

关键词

引用

@article{arxiv.2512.19823,
  title  = {Learning to Refocus with Video Diffusion Models},
  author = {SaiKiran Tedla and Zhoutong Zhang and Xuaner Zhang and Shumian Xin},
  journal= {arXiv preprint arXiv:2512.19823},
  year   = {2025}
}

备注

Code and data are available at https://learn2refocus.github.io . SIGGRAPH Asia 2025, Dec. 2025