Magic Clothing:可控的服装驱动图像合成
计算机视觉与模式识别
2024-07-25 v2
摘要
我们提出了 Magic Clothing,一种基于潜在扩散模型 (LDM) 的网络架构,用于尚未探索的服装驱动图像合成任务。该任务旨在生成穿着目标服装并带有多样化文本提示的定制化角色,图像可控性是最关键的问题,即保留服装细节并保持对文本提示的忠实度。为此,我们引入了一个服装提取器来捕捉详细的服装特征,并采用自注意力融合将其整合到预训练的 LDM 中,确保服装细节在目标角色上保持不变。然后,我们利用联合无分类器指导来平衡服装特征和文本提示对生成结果的控制。同时,所提出的服装提取器是一个即插即用模块,适用于各种微调后的 LDM,并且可以与 ControlNet 和 IP-Adapter 等其他扩展结合,以增强生成角色的多样性和可控性。此外,我们设计了 Matched-Points-LPIPS (MP-LPIPS),这是一种用于评估目标图像与源服装一致性的稳健指标。大量实验表明,我们的 Magic Clothing 在服装驱动图像合成的各种条件控制下均取得了 state-of-the-art 的结果。源代码可在 https://github.com/ShineChen1024/MagicClothing 获取。
引用
@article{arxiv.2404.09512,
title = {Magic Clothing: Controllable Garment-Driven Image Synthesis},
author = {Weifeng Chen and Tao Gu and Yuhao Xu and Chengcai Chen},
journal= {arXiv preprint arXiv:2404.09512},
year = {2024}
}