中文

生成式多焦点图像融合

计算机视觉与模式识别 2025-12-29 v1

摘要

多焦点图像融合旨在从一系列部分聚焦的输入图像中生成全焦点图像。现有融合算法通常假设对于场景中的每个空间位置,至少有一个输入图像中该位置是聚焦的。此外,当前融合模型在复杂现实场景中常因焦点估计不确定或硬选择操作而产生边缘伪影。为解决这些限制,我们提出一种生成式多焦点图像融合框架,称为 GMFF,其以两个连续阶段运行。在第一个阶段,使用 StackMFF V4(最新版本的 StackMFF 系列),并整合可用焦点平面信息,以产生初始融合图像。第二个阶段采用 IFControlNet 实现生成式恢复,利用潜在扩散模型的生成能力从缺失的焦点平面重建内容、恢复细节,并消除边缘伪影。每个阶段独立开发,可级联式无缝运行。广泛实验表明,GMFF 实现了最先进的融合性能,并在涉及复杂多焦点内容的场景中展现出显著的实际应用潜力。实现代码已公开于 https://github.com/Xinzhe99/StackMFF-Series。

关键词

引用

@article{arxiv.2512.21495,
  title  = {Generative Multi-Focus Image Fusion},
  author = {Xinzhe Xie and Buyu Guo and Bolin Li and Shuangyan He and Yanzhen Gu and Qingyan Jiang and Peiliang Li},
  journal= {arXiv preprint arXiv:2512.21495},
  year   = {2025}
}