中文

Pick-and-Draw:面向文本到图像个性化的免训练语义引导

计算机视觉与模式识别 2024-01-31 v1

摘要

基于扩散的文本到图像个性化在生成用户指定的主体于各种上下文中取得了巨大成功。即便如此,现有的基于微调的方法仍然遭受模型过拟合的困扰,这极大地损害了生成多样性,尤其是在给定主体图像很少的情况下。为此,我们提出了 Pick-and-Draw,一种免训练的语义引导方法,以提升个性化方法的身份一致性和生成多样性。我们的方法包含两个组件:外观拾取引导和布局绘制引导。对于前者,我们利用参考图像中的视觉特征构建一个外观调色板,从中拾取局部模式以生成具有一致身份的指定主体。对于布局绘制,我们参照原始扩散模型的生成模板勾勒出主体的轮廓,并继承强大的图像先验,根据不同的文本条件合成多样化的上下文。所提出的方法可以应用于任何个性化扩散模型,并且只需要少至一张参考图像。定性和定量实验表明,Pick-and-Draw 持续提升了身份一致性和生成多样性,将主体保真度与图像-文本保真度之间的权衡推向了新的帕累托前沿。

关键词

引用

@article{arxiv.2401.16762,
  title  = {Pick-and-Draw: Training-free Semantic Guidance for Text-to-Image Personalization},
  author = {Henglei Lv and Jiayu Xiao and Liang Li and Qingming Huang},
  journal= {arXiv preprint arXiv:2401.16762},
  year   = {2024}
}