无掩码扩散的通用服装风格编辑:AnyDesign
计算机视觉与模式识别
2024-10-18 v4
摘要
服装图像编辑旨在根据给定指令修改人物的外观。现有方法需要诸如分割器和关键点提取器等辅助工具,缺乏灵活且统一的框架。此外,这些方法在可以处理的服装类型种类上受限,因为大多数数据集侧重于干净背景下的人物,仅包含泛泛的服装如上衣、裤子和连衣裙。这些限制restricts了其在实际场景中的适用性。本文首先扩展了现有的人类生成数据集,涵盖更广泛的服装范围和更复杂的背景。该扩展数据集包括佩戴多样化物品(如上衣、裤子、连衣裙、裙子、头饰、围巾、鞋子、袜子和包袋)的人物。此外,我们提出AnyDesign,一种基于扩散模型的方法,可实现对多样化区域的无掩码编辑。用户只需输入人物图像及其对应的提示(以文本或图像格式)即可。我们的方案融入Fashion DiT,配备Fashion-Guidance Attention(FGA)模块,用于整合显式服装类型和CLIP编码的服装特征。定性和定量实验表明,我们的方法能够提供高质量的服装编辑,并优于当代文本驱动的服装编辑方法。
引用
@article{arxiv.2408.11553,
title = {AnyDesign: Versatile Area Fashion Editing via Mask-Free Diffusion},
author = {Yunfang Niu and Lingxiang Wu and Dong Yi and Jie Peng and Ning Jiang and Haiying Wu and Jinqiao Wang},
journal= {arXiv preprint arXiv:2408.11553},
year = {2024}
}