中文

FDS:面向文本引导潜在扩散图像编辑的频率感知去噪分数

计算机视觉与模式识别 2025-03-26 v1

摘要

使用文本到图像(T2I)模型的文本引导图像编辑常常无法产生令人满意的结果,经常引入非预期的修改,例如局部细节的丢失与颜色的变化。在本文中,我们分析了这些失败案例,并将其归因于对所有频段的盲目优化,尽管实际上只有特定频率可能需要调整。为了解决这一问题,我们引入了一种简单而有效的方法,能够在局部空间区域内选择性地优化特定频段以实现精确编辑。我们的方法利用小波将图像分解为跨多个频段的不同空间分辨率,从而实现不同细节层次上的精确修改。为了扩展我们方法的适用性,我们对不同的频域技术进行了比较分析。此外,我们通过在三平面(triplane)表示上执行频率分解,将方法扩展到 3D 纹理编辑,从而实现 3D 纹理的频率感知调整。定量评估与用户研究表明了我们的方法在生成高质量且精确编辑方面的有效性。

关键词

引用

@article{arxiv.2503.19191,
  title  = {FDS: Frequency-Aware Denoising Score for Text-Guided Latent Diffusion Image Editing},
  author = {Yufan Ren and Zicong Jiang and Tong Zhang and Søren Forchhammer and Sabine Süsstrunk},
  journal= {arXiv preprint arXiv:2503.19191},
  year   = {2025}
}

备注

8 pages (main paper)