M6-UFC:通过非自回归生成式 Transformer 统一多模态控制以实现条件图像合成
计算机视觉与模式识别
2022-02-22 v4
摘要
条件图像合成旨在根据文本描述、参考图像和需保留的图像块及其组合等形式的一些多模态引导来创建图像。本文中,我们不是分别研究这些控制信号,而是提出一种新的两阶段架构 M6-UFC,以统一任意数量的多模态控制。在 M6-UFC 中,多样的控制信号和合成图像均统一表示为离散 token 序列,由 Transformer 处理。不同于 DALL-E 和 VQGAN 等现有的两阶段自回归方法,M6-UFC 在第二阶段采用非自回归生成(NAR)以增强合成图像的整体一致性、支持保留指定图像块并提升合成速度。进一步,我们设计了一种渐进式算法,借助分别为评估对控制的依从性和评估合成图像保真度而开发的两个估计器,迭代改进非自回归生成的图像。在新收集的大规模服装数据集 M2C-Fashion 和人脸数据集 Multi-Modal CelebA-HQ 上的大量实验验证了 M6-UFC 能合成符合灵活多模态控制的高保真图像。
引用
@article{arxiv.2105.14211,
title = {M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers},
author = {Zhu Zhang and Jianxin Ma and Chang Zhou and Rui Men and Zhikang Li and Ming Ding and Jie Tang and Jingren Zhou and Hongxia Yang},
journal= {arXiv preprint arXiv:2105.14211},
year = {2022}
}
备注
Accepted by NeurIPS21