中文

生成式图像模型的细粒度景深模糊控制

计算机视觉与模式识别 2025-12-15 v2

摘要

当前文本到图像扩散模型在生成多样化高质量图像方面表现出色,但在纳入细粒度摄影机元数据(如精确光圈设置)方面尚有不足。本文引入一种新颖的文本到图像扩散框架,利用摄影机元数据(即EXIF数据)——这些数据通常嵌入图像文件中——并着重于生成可控的镜头模糊。该方法通过首先生成全景深的图像、估计其单目深度、预测合理的焦点距离(采用新颖的焦点距离变换器),然后通过现有的可微分镜头模糊模型生成退化图像。梯度能够反向传播通过整个过程,从而允许我们在没有显式监督的情况下学习生成基于内容元素和提供的EXIF数据的退化效果。在推理阶段,这使我们能够实现对景深效果的精确交互式控制,同时保留场景内容,这是现有扩散模型无法实现的。实验结果表明,我们的模型在不改变场景内容的前提下,实现了优越的细粒度控制。

关键词

引用

@article{arxiv.2510.06215,
  title  = {Fine-grained Defocus Blur Control for Generative Image Models},
  author = {Ayush Shrivastava and Connelly Barnes and Xuaner Zhang and Lingzhi Zhang and Andrew Owens and Sohrab Amirghodsi and Eli Shechtman},
  journal= {arXiv preprint arXiv:2510.06215},
  year   = {2025}
}

备注

Project link: https://www.ayshrv.com/defocus-blur-gen