中文

基于原型嵌入的文本到图像扩散模型对象驱动单样本微调

计算机视觉与模式识别 2024-01-30 v1

摘要

随着大规模文本到图像生成模型在文本到图像生成领域取得显著进展,许多微调方法被提出。然而,这些模型在处理新对象时往往存在困难,特别是在单样本场景下。我们提出的方法旨在以对象驱动的方式,仅使用单张输入图像和对象特定的感兴趣区域,来解决泛化性和保真度的挑战。为了提高泛化性并缓解过拟合,在我们的范式中,在对扩散模型进行微调之前,基于对象的外观及其类别初始化一个原型嵌入。在微调过程中,我们提出了一种类别表征正则化来保留对象类别的先验知识。为了进一步提高保真度,我们引入了对象特定损失,该损失也可用于植入多个对象。总体而言,我们提出的用于植入新对象的对象驱动方法能够与现有概念无缝整合,并具有高保真度和泛化性。我们的方法优于现有的几项工作。代码将予以发布。

关键词

引用

@article{arxiv.2401.15708,
  title  = {Object-Driven One-Shot Fine-tuning of Text-to-Image Diffusion with Prototypical Embedding},
  author = {Jianxiang Lu and Cong Xie and Hui Guo},
  journal= {arXiv preprint arXiv:2401.15708},
  year   = {2024}
}