中文

通过正交微调控制文本到图像扩散模型

计算机视觉与模式识别 2024-03-15 v3 人工智能 图形学 机器学习

摘要

大型文本到图像扩散模型在根据文本提示生成逼真图像方面具有令人印象深刻的能力。如何有效引导或控制这些强大模型执行不同的下游任务成为一个重要的开放问题。为应对这一挑战,我们提出一种原则性的微调方法——正交微调(OFT),用于将文本到图像扩散模型适配到下游任务。与现有方法不同,OFT 可证明地保持超球面能量,该能量刻画了单位超球面上神经元间的成对关系。我们发现这一性质对于保持文本到图像扩散模型的语义生成能力至关重要。为提高微调稳定性,我们进一步提出约束正交微调(COFT),对超球面施加额外的半径约束。具体而言,我们考虑两个重要的文本到图像微调任务:主体驱动生成(目标是在给定少量主体图像和文本提示时生成特定主体的图像)与可控生成(目标是使模型能够接收额外的控制信号)。我们通过实验表明,我们的 OFT 框架在生成质量和收敛速度上均优于现有方法。

关键词

引用

@article{arxiv.2306.07280,
  title  = {Controlling Text-to-Image Diffusion by Orthogonal Finetuning},
  author = {Zeju Qiu and Weiyang Liu and Haiwen Feng and Yuxuan Xue and Yao Feng and Zhen Liu and Dan Zhang and Adrian Weller and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2306.07280},
  year   = {2024}
}

备注

NeurIPS 2023 (v3: fixed formula typos in Section 3.5, 43 pages, 34 figures, project page: https://oft.wyliu.com/)