中文

MC$^2$:面向定制化多概念生成的多概念引导

计算机视觉与模式识别 2024-12-03 v3

摘要

定制化文本到图像生成根据用户指定的概念合成图像,在处理单个概念方面取得了显著进展。然而,当扩展到多个概念时,现有方法往往难以正确整合不同的模型,并避免不同概念特征的意外混合。在本文中,我们提出了 MC2^2,这是一种用于多概念定制化的新方法,通过推理时优化来增强灵活性和保真度。MC2^2 能够整合具有异构架构的多个单概念模型。通过自适应地细化视觉和文本标记之间的注意力权重,我们的方法确保图像区域准确地对应其关联概念,同时最小化概念之间的干扰。大量实验表明,MC2^2 在提示-参考对齐方面优于基于训练的方法。此外,MC2^2 可无缝应用于文本到图像生成,提供强大的组合能力。为了促进多概念定制化的评估,我们还引入了一个新的基准测试 MC++。代码将在 https://github.com/JIANGJiaXiu/MC-2 公开。

关键词

引用

@article{arxiv.2404.05268,
  title  = {MC$^2$: Multi-concept Guidance for Customized Multi-concept Generation},
  author = {Jiaxiu Jiang and Yabo Zhang and Kailai Feng and Xiaohe Wu and Wenbo Li and Renjing Pei and Fan Li and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2404.05268},
  year   = {2024}
}

备注

14 pages, 14 figures