中文

基于扩散模型的多对象图像编辑:MDE-Edit

计算机视觉与模式识别 2025-05-13 v2

摘要

多对象编辑旨在修改复杂场景中多个对象或区域,同时保持结构一致性。该任务在涉及重叠或相互作用对象的情景中面临重大挑战:(1)由于注意力错位,导致目标对象定位不准,引起不完整或错误的编辑;(2)属性-对象不匹配,即颜色或纹理变化未与预期区域对齐,由于跨注意力泄漏导致在非目标区域产生语义冲突(例如颜色渗漏到非目标区域)。现有方法难以解决这些挑战:依赖全局跨注意力机制的方法受注意力稀释和对象之间空间干扰影响,而基于掩码的方法由于多对象情景中的特征纠缠,无法将属性绑定到几何准确的区域。为解决这些限制,我们提出了一种训练-free、在推理阶段进行优化的方法,使其能够在复杂多对象场景中实现精确的局部图像操控,命名为 MDE-Edit。MDE-Edit 通过两个关键损失优化扩散模型中的噪声潜在特征:对象对齐损失(OAL)将多层跨注意力与分割掩码对齐,以实现精确的对象定位;颜色一致性损失(CCL)放大掩码内的目标属性注意力,同时抑制对相邻区域的泄漏。这种双损失设计确保了局部且连贯的多对象编辑。大量实验表明,MDE-Edit 在编辑精度和视觉质量方面优于最先进的方法,为复杂多对象图像操控任务提供了稳健的解决方案。

关键词

引用

@article{arxiv.2505.05101,
  title  = {MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models},
  author = {Hongyang Zhu and Haipeng Liu and Bo Fu and Yang Wang},
  journal= {arXiv preprint arXiv:2505.05101},
  year   = {2025}
}

备注

9 pages, 7 figures