SuTI:基于学徒学习的主体驱动文本到图像生成
摘要
近来,诸如 DreamBooth 等文本到图像生成模型通过对少量样本的目标主体微调“专家模型”,在生成高度定制的目标主体图像方面取得了显著进展。然而,该过程代价高昂,因为每个主体都必须学习一个新的专家模型。本文提出 SuTI,一种以情境学习替代主体特定微调的主体驱动文本到图像生成器。给定新主体的少量示例,SuTI 无需任何主体特定的优化,即可即时生成该主体在不同场景中的新颖图像。SuTI 由学徒学习驱动,即从大量主体特定专家模型生成的数据中学习单一的学徒模型。具体而言,我们从互联网中挖掘数百万个图像簇,每个簇围绕一个特定视觉主体。我们利用这些簇训练大量专家模型,每个模型专攻不同主体。随后学徒模型 SuTI 学习模仿这些微调专家的行为。SuTI 生成高质量且定制化的主体特定图像的速度比基于优化的 SOTA 方法快 20 倍。在具有挑战性的 DreamBench 和 DreamBench-v2 上,我们的人工评估表明,SuTI 显著优于 InstructPix2Pix、Textual Inversion、Imagic、Prompt2Prompt、Re-Imagen 和 DreamBooth 等现有模型,尤其在主体与文本对齐方面。
引用
@article{arxiv.2304.00186,
title = {Subject-driven Text-to-Image Generation via Apprenticeship Learning},
author = {Wenhu Chen and Hexiang Hu and Yandong Li and Nataniel Ruiz and Xuhui Jia and Ming-Wei Chang and William W. Cohen},
journal= {arXiv preprint arXiv:2304.00186},
year = {2023}
}
备注
Accepted at NeurIPS 2023. Model Service to be appear as Google Vertex AI - Instant Tuning (https://cloud.google.com/vertex-ai/docs/generative-ai/image/fine-tune-model). The link to demo video: https://www.youtube.com/watch?v=Q2xQ91D_dhM&t=2071s&ab_channel=GoogleCloud