中文

用于扩散模型模块化定制的正交自适应方法

计算机视觉与模式识别 2024-12-06 v3

摘要

文本到图像模型的定制化技术为一系列以前无法实现的应用铺平了道路,使得能够在多样的上下文和风格中生成特定概念。虽然现有方法促进了对单个概念或有限的预定义概念集的高保真定制,但它们在实现可扩展性方面存在不足,即单一模型无法无缝渲染无数概念。在本文中,我们探讨了一个称为模块化定制的新问题,目标是高效地合并针对单个概念独立微调的定制模型。这使得合并后的模型能够在一张图像中联合合成多个概念,且不损害保真度或产生任何额外的计算成本。为解决这一问题,我们引入了正交自适应,该方法旨在鼓励在微调期间彼此无法访问的定制模型具有正交的残差权重。这确保了在推理阶段,定制模型可以以最小的干扰进行相加。我们提出的方法既简单又通用,适用于模型架构中几乎所有可优化的权重。通过大量的定量和定性评估,我们的方法在效率和身份保持方面始终优于相关基线,展示了向扩散模型可扩展定制化迈出的重要一步。

关键词

引用

@article{arxiv.2312.02432,
  title  = {Orthogonal Adaptation for Modular Customization of Diffusion Models},
  author = {Ryan Po and Guandao Yang and Kfir Aberman and Gordon Wetzstein},
  journal= {arXiv preprint arXiv:2312.02432},
  year   = {2024}
}

备注

Project page: https://ryanpo.com/ortha/ Hugging Face Demo: https://huggingface.co/spaces/ujin-song/ortha