中文

一种面向文本引导图像填充的空文本空频率感知扩散模型

计算机视觉与模式识别 2025-10-28 v5

摘要

文本引导图像填充旨在根据文本提示重建被遮盖区域,长期以来面临的挑战在于同时保持未遮盖区域的完整性,以及实现遮盖区域与未遮盖区域之间的语义一致性。以往方法未能同时解决这两个问题,总是其中一个得不到妥善解决。我们观察到,这源于混合(如中低频)频段的纠缠,这些频段编码了不同的图像属性,在去噪过程中对文本提示的鲁棒性不同。本文提出一种空文本空频率感知扩散模型,称为NTN-Diff,用于文本引导图像填充,通过将语义一致性在遮盖区域与未遮盖区域之间的一致性分解为各频段的一致性,来规避两个挑战。基于扩散过程,我们进一步将去噪过程分为早期(高层噪声)和晚期(低层噪声)阶段,在去噪过程中实现中低频带的解耦。观察发现,稳定的中频带在文本引导去噪过程中逐渐去噬以实现语义对齐,同时作为指导空文本去噪过程,对被遮盖区域的低频带进行去噬,随后在晚期阶段进行文本引导去噬,以实现中低频带在遮盖区域与未遮盖区域之间的语义一致性,同时保持未遮盖区域的完整性。广泛的实验验证了NTN-Diff在文本引导扩散模型方面优于现有方法。我们的代码可在https://github.com/htyjers/NTN-Diff获取。

关键词

引用

@article{arxiv.2510.08273,
  title  = {One Stone with Two Birds: A Null-Text-Null Frequency-Aware Diffusion Models for Text-Guided Image Inpainting},
  author = {Haipeng Liu and Yang Wang and Meng Wang},
  journal= {arXiv preprint arXiv:2510.08273},
  year   = {2025}
}

备注

27 pages, 11 figures, to appear at NeurIPS 2025