中文

DreamTuner:单张图像即可实现主体驱动生成

计算机视觉与模式识别 2023-12-22 v1

摘要

基于扩散的模型在文本到图像生成方面展示了令人印象深刻的能力,并被期望用于主体驱动生成的个性化应用,这需要基于一张或少数几张参考图像生成定制概念。然而,现有的基于微调的方法未能平衡主体学习与保持预训练模型生成能力之间的权衡。此外,其他利用额外图像编码器的方法往往由于编码压缩而丢失主体的重要细节。为应对这些挑战,我们提出了 DreamTuner,这是一种从粗到细注入参考信息的新方法,以更有效地实现主体驱动的图像生成。DreamTuner 引入了一个主体编码器用于粗略的主体身份保持,其中压缩的通用主体特征通过视觉 - 文本交叉注意力之前的注意力层引入。随后,我们修改预训练文本到图像模型中的自注意力层为自主体注意力层,以细化目标主体的细节。生成的图像在自主体注意力中从参考图像和自身查询详细特征。值得强调的是,自主体注意力是一种有效、优雅且无需训练的方法,用于保持定制主体的详细特征,并可作为推理期间的即插即用解决方案。最后,通过额外的主体驱动微调,DreamTuner 在主体驱动图像生成方面取得了卓越的性能,可由文本或其他条件(如姿态)控制。更多详情请访问项目页面:https://dreamtuner-diffusion.github.io/。

关键词

引用

@article{arxiv.2312.13691,
  title  = {DreamTuner: Single Image is Enough for Subject-Driven Generation},
  author = {Miao Hua and Jiawei Liu and Fei Ding and Wei Liu and Jie Wu and Qian He},
  journal= {arXiv preprint arXiv:2312.13691},
  year   = {2023}
}