中文

MTADiffusion:基于遮罩-文本对齐扩散模型的对象图像填充

计算机视觉与模式识别 2025-07-01 v1

摘要

生成模型的进展使图像填充模型能够根据提供的提示和遮罩在图像的特定区域生成内容。然而,现有的填充方法常常存在语义错位、结构畸变和风格不一致等问题。本文提出MTADiffusion,一种为对象填充设计的遮罩-文本对齐扩散模型。为增强填充模型的语义能力,我们引入MTAPipeline,这是一种自动为遮罩标注详细描述的解决方案。基于MTAPipeline,我们构建了一个新的MTADataset数据集,包含500万张图像和2500万组遮罩-文本对。此外,我们提出了一种多任务训练策略,将填充任务和边缘预测任务集成,以提高结构稳定性。为促进风格一致性,我们提出了一种新型填充风格一致性损失,利用预训练的VGG网络和Gram矩阵。对BrushBench和EditBench上的全面评估表明,MTADiffusion在其他方法之上实现了最先进的性能。

关键词

引用

@article{arxiv.2506.23482,
  title  = {MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting},
  author = {Jun Huang and Ting Liu and Yihang Wu and Xiaochao Qu and Luoqi Liu and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2506.23482},
  year   = {2025}
}

备注

CVPR 2025