基于掩码预测和注意力增强扩散的文本引导时尚图像编辑模型MADiff
计算机视觉与模式识别
2025-01-16 v2
摘要
文本引导的图像编辑模型在通用领域取得了很大的成功。然而,直接将这些模型应用于时尚领域可能遭遇两个问题:(1)编辑区域定位不准确;(2)编辑幅度较弱。为此提出了MADiff模型。具体而言,为更准确地识别编辑区域,提出了MaskNet,在其中将前景区域、densepose和来自大语言模型的掩码提示输入到轻量级UNet中,以预测编辑区域的掩码。为增强编辑幅度,提出了注意力增强扩散模型,其中将噪声图、注意力图以及来自MaskNet的掩码输入到所提出的注意力处理器中,以产生精炼后的噪声图。通过将精炼后的噪声图整合到扩散模型中,可实现编辑后图像更好地与目标提示对齐。由于缺乏时尚图像编辑基准,本文构建了一个名为Fashion-E的数据集,包含训练集中的28390张图像-文本对,以及评估集中2639张四类时尚任务的图像-文本对。在Fashion-E上的大量实验表明,我们提出的方法在时尚图像编辑中能够准确预测编辑区域的掩码,并显著提升编辑幅度,优于当前最先进的方法。
引用
@article{arxiv.2412.20062,
title = {MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion},
author = {Zechao Zhan and Dehong Gao and Jinxia Zhang and Jiale Huang and Yang Hu and Xin Wang},
journal= {arXiv preprint arXiv:2412.20062},
year = {2025}
}