统一注意力图:提升重构和编辑中的图像保真度
计算机视觉与模式识别
2024-12-02 v1 人工智能
机器学习
摘要
基于扩散模型的文本引导图像生成和编辑已取得显著进展。在这些方法中,调参-free 方法因其无需大量模型调整、操作简便和高效等优势而受到关注。然而,现有的调参-free 方法往往在图像保真度和编辑精确度之间难以取得平衡。DDIM Inversion 中的重构误差部分归因于 U-Net 中的 cross-attention mechanism,这种机制在 inversion 和重构过程中引入了错位。为此,我们从结构层面分析重构,提出了一种新方法,用 uniform attention maps 替代传统的 cross-attention,从而显著提升了图像重构保真度。我们的方法有效地最小化了由于文本条件变化导致的噪声预测中的各种扭曲。为补充这一改进,我们引入一种自适应 mask-guided 编辑技术,无缝集成到我们的重构方法中,确保编辑任务的一致性和准确性。实验结果表明,我们的方法不仅在实现高保真度图像重构方面卓越,而且在真实图像 composition 和编辑场景中表现出稳健的鲁棒性。这一研究凸显了统一注意力图在提高扩散基于图像处理方法保真度和灵活性方面的潜力。代码已在 https://github.com/Mowenyii/Uniform-Attention-Maps 上提供。
引用
@article{arxiv.2411.19652,
title = {Uniform Attention Maps: Boosting Image Fidelity in Reconstruction and Editing},
author = {Wenyi Mo and Tianyu Zhang and Yalong Bai and Bing Su and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2411.19652},
year = {2024}
}
备注
Accepted to WACV 2025