通过混合掩码信息融合增强文本到图像编辑
计算机视觉与模式识别
2024-09-20 v2
摘要
最近,扩散模型的应用极大地推动了文本到图像(T2I)编辑的发展。尽管生成的图像在视觉上令人期待,但与预期文本提示的不一致仍然普遍存在。本文旨在通过解决扩散模型基于文本引导的图像编辑技术的局限性,系统地改进这些技术。值得注意的是,基于扩散的编辑中的常见思路首先通过反演技术(例如DDIM反演)重建源图像,然后进行融合过程,仔细地将源中间(隐藏)状态(通过反演获得)与目标图像的状态整合。不幸的是,由于纹理保留和新角色创建在某些区域的干扰,这种标准流程在许多情况下失败。为了缓解这一问题,我们将人工标注作为外部知识纳入,将编辑限制在“掩码信息”区域内。然后,我们在模型的自注意力模块中仔细地将编辑后的图像与源图像以及构建的中间图像进行融合。大量实证结果表明,所提出的“MaSaFusion”显著改进了现有的T2I编辑技术。
引用
@article{arxiv.2405.15313,
title = {Enhancing Text-to-Image Editing via Hybrid Mask-Informed Fusion},
author = {Aoxue Li and Mingyang Yi and Zhenguo Li},
journal= {arXiv preprint arXiv:2405.15313},
year = {2024}
}