DiffCloth:基于扩散模型与结构跨模态语义对齐的服装合成与编辑
计算机视觉与模式识别
2023-08-23 v1
摘要
跨模态服装合成与编辑将显著惠及时尚设计师通过灵活的语言界面生成服装并修改其设计。当前方法遵循通用的文本到图像范式,并通过简单的交叉注意力模块挖掘跨模态关系,忽视了时尚设计领域中视觉与文本表征之间的结构对应。本工作中,我们提出DiffCloth,一种基于扩散模型的跨模态服装合成与编辑流水线,它通过结构对齐跨模态语义,赋予扩散模型在时尚领域灵活的 compositional 能力。具体而言,我们将部件级跨模态对齐形式化为语言属性短语(AP)与视觉服装部件之间的二部匹配问题,前者通过成分解析获得,后者通过语义分割获得。为缓解属性混淆问题,我们进一步提出语义捆绑交叉注意力,以在每个AP中保持属性形容词与部件名词注意力图之间的空间结构相似性。此外,DiffCloth允许通过简单替换文本提示中的AP来编辑生成结果。与编辑无关的区域由从AP的捆绑注意力图获得的混合掩码识别并保持不变。在CM-Fashion基准上的大量实验表明,DiffCloth既利用固有结构信息取得了SOTA的服装合成结果,又支持具有区域一致性的灵活编辑。
引用
@article{arxiv.2308.11206,
title = {DiffCloth: Diffusion Based Garment Synthesis and Manipulation via Structural Cross-modal Semantic Alignment},
author = {Xujie Zhang and Binbin Yang and Michael C. Kampffmeyer and Wenqing Zhang and Shiyue Zhang and Guansong Lu and Liang Lin and Hang Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2308.11206},
year = {2023}
}
备注
accepted by ICCV2023