中文

VMix:通过跨注意力混合控制提升文本到图像扩散模型的表现

计算机视觉与模式识别 2024-12-31 v1

摘要

尽管扩散模型在文本到图像生成方面展现出惊人的才能,但它们仍可能无法生成高度审美的图像。更具体地说,在细粒度维度上(包括颜色、光照、构图等方面),生成图像与真实世界审美图像之间仍存在差距。本文提出了跨注意力值混合控制(VMix)适配器,一种即插即用的审美适配器,用于在保持通用性的同时提升生成图像的质量(1)通过审美嵌入的初始化将输入文本提示分解为内容描述和审美描述,(2)通过值混合的跨注意力整合审美条件进入去噪过程中,网络由零初始化的线性层连接。我们的关键洞见是通过设计优异的条件控制方法来增强现有扩散模型的审美表现,同时保持图像-文本对齐。通过严谨的设计,VMix 足够灵活,可应用于社区模型以获得更好的视觉表现,无需重新训练。为验证我们方法的有效性,我们进行了广泛实验,表明 VMix 在其他领先方法之上并与其他社区模块(如 LoRA、ControlNet 和 IPAdapter)兼容,可用于图像生成。项目页面为 https://vmix-diffusion.github.io/VMix/。

关键词

引用

@article{arxiv.2412.20800,
  title  = {VMix: Improving Text-to-Image Diffusion Model with Cross-Attention Mixing Control},
  author = {Shaojin Wu and Fei Ding and Mengqi Huang and Wei Liu and Qian He},
  journal= {arXiv preprint arXiv:2412.20800},
  year   = {2024}
}

备注

Codes and models are available at https://github.com/fenfenfenfan/VMix