LOCATEEdit:用于局部化文本引导图像编辑的图拉普拉斯优化交叉注意力
计算机视觉与模式识别
2025-03-31 v2 人工智能
摘要
文本引导图像编辑旨在根据自然语言指令修改图像的特定区域,同时保持整体结构和背景保真度。现有方法利用从扩散模型生成的交叉注意力图导出的掩码来识别待修改的目标区域。然而,由于交叉注意力机制侧重于语义相关性,它们难以保持图像完整性。因此,这些方法通常缺乏空间一致性,导致编辑伪影和畸变。在本工作中,我们解决了这些局限性并引入了 LOCATEEdit,它通过基于图的方法增强交叉注意力图,利用自注意力导出的图像块关系来保持图像区域间平滑、连贯的注意力,确保修改仅限于指定项目同时保留周围结构。LOCATEEdit 在 PIE-Bench 上一致且显著地优于现有基线,证明了其在各种编辑任务上的最先进性能和有效性。代码可在 https://github.com/LOCATEdit/LOCATEdit/ 找到。
引用
@article{arxiv.2503.21541,
title = {LOCATEdit: Graph Laplacian Optimized Cross Attention for Localized Text-Guided Image Editing},
author = {Achint Soni and Meet Soni and Sirisha Rambhatla},
journal= {arXiv preprint arXiv:2503.21541},
year = {2025}
}