M6-Fashion:高保真多模态图像生成与编辑
计算机视觉与模式识别
2022-05-25 v1 人工智能
多媒体
摘要
时尚产业在多模态图像生成与编辑方面具有多样的应用。其旨在以多模态条件信号作为引导来创建所需的高保真图像。大多数现有方法通过引入额外模型或忽略风格先验知识来学习不同的条件引导控制,难以处理多种信号组合并面临低保真问题。在本文中,我们将风格先验知识和多模态控制的灵活性同时适配进一个统一的两阶段框架 M6-Fashion,聚焦于实用的 AI 辅助时尚设计。它在第一阶段于空间和语义维度上解耦风格编码,以保证高保真图像生成。M6-Fashion 利用非自回归生成的自我修正来提高推理速度、增强整体一致性并支持各种信号控制。在大规模服装数据集 M2C-Fashion 上的大量实验证明了其在各种图像生成与编辑任务上的优越性能。M6-Fashion 模型作为时尚产业中极具潜力的 AI 设计师。
引用
@article{arxiv.2205.11705,
title = {M6-Fashion: High-Fidelity Multi-modal Image Generation and Editing},
author = {Zhikang Li and Huiling Zhou and Shuai Bai and Peike Li and Chang Zhou and Hongxia Yang},
journal= {arXiv preprint arXiv:2205.11705},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2105.14211