DreamArtist++:基于正负适配器的可控单样本文本到图像生成
计算机视觉与模式识别
2025-01-31 v4 计算与语言
多媒体
摘要
当前最先进的文本到图像生成模型,如 Imagen 与 Stable Diffusion Model,在以人类文本提示引导合成高分辨率、特征丰富且高质量的图像方面已取得显著进展。由于图像内容的某些特征(例如非常特定的物体实体或风格)很难用文本准确描述,一些基于示例的图像生成方法被提出,即基于吸收少量输入参考的显著特征来生成新概念。尽管已取得公认成功,这些方法在准确捕捉参考示例特征的同时保持多样且高质量的图像生成方面仍存在困难,尤其在单样本场景(即仅给定一张参考)下。为解决该问题,我们提出了一种简洁而有效的框架,称为 DreamArtist,其在预训练扩散模型上采用新颖的正负提示微调学习策略,并已证明仅用单张参考示例即可良好处理图像生成的准确可控性与保真度之间的权衡。具体而言,我们所提框架同时引入正负嵌入或适配器,并以联合方式优化二者。正部分积极捕捉参考图像的显著特征以驱动多样化生成,负部分则纠正正部分的不足。我们进行了大量实验,并从图像相似度(保真度)与多样性、生成可控性以及风格克隆等方面评估了所提方法。我们的 DreamArtist 相较现有方法取得了更优的生成性能。此外,我们在扩展任务(包括概念组合与提示引导图像编辑)上的补充评估证明了其在更多应用中的有效性。
引用
@article{arxiv.2211.11337,
title = {DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter},
author = {Ziyi Dong and Pengxu Wei and Liang Lin},
journal= {arXiv preprint arXiv:2211.11337},
year = {2025}
}