中文

C3Net:面向多模态内容生成的复合条件ControlNet

机器学习 2023-12-01 v1

摘要

我们提出复合条件ControlNet,C3Net,一种新颖的生成神经架构,接收来自多模态的条件并同时合成多模态内容(如图像、文本、音频)。C3Net改造ControlNet架构以联合训练并在生产可用的扩散模型及其可训练副本上推理。具体而言,C3Net首先使用基于对比训练的多模态特定编码器将多模态条件对齐到同一语义潜空间。然后,它基于对齐的潜空间生成多模态输出,其语义信息使用称为Control C3-UNet的类似ControlNet的架构进行组合。相应地,借助该系统设计,我们的模型通过学习并解释多模态条件(而非简单在潜空间上做线性插值)为联合模态生成提供了改进方案。同时,由于我们将条件对齐到统一潜空间,C3Net仅需一个可训练的Control C3-UNet来处理多模态语义信息。此外,我们的模型在条件对齐阶段采用单模态预训练,即使在相对稀缺的训练数据上也优于非预训练对齐,从而展示出高质量的复合条件生成。我们贡献了首个高质量三模态验证集,定量验证C3Net优于或与一流及同期最先进多模态生成方法相当。我们的代码与三模态数据集将发布。

关键词

引用

@article{arxiv.2311.17951,
  title  = {C3Net: Compound Conditioned ControlNet for Multimodal Content Generation},
  author = {Juntao Zhang and Yuehuai Liu and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:2311.17951},
  year   = {2023}
}