基于参考引导的条件文本到图像生成
计算机视觉与模式识别
2025-12-15 v2
摘要
文本到图像扩散模型在给定文本指令的情况下已显示出在合成视觉上令人惊叹的图像方面的巨大成功。尽管在创建高保真视觉效果方面取得了显著进展,但文本到图像模型仍然在精确渲染主体方面(例如文本拼写)时会感到困难。为此,本文探索了使用提供特定主体视觉指导的图像附加条件,以帮助扩散模型生成。在此基础上,该参考条件使模型能够以文本标记器的词汇表无法充分表示的方式进行条件化,并进一步扩展了模型对新能力的泛化,如生成非英文文本拼写。我们开发了若干小规模专家插件,有效地为 Stable Diffusion 模型提供了能够使用不同参考图像的能力。每个插件都使用针对英语场景文本生成、多语言场景文本生成和标志图像生成等应用定制的辅助网络和损失函数进行训练。我们的专家插件在所有任务上均优于现有方法,每个插件仅包含 28.55M 可训练参数。
引用
@article{arxiv.2411.16713,
title = {Conditional Text-to-Image Generation with Reference Guidance},
author = {Taewook Kim and Ze Wang and Zhengyuan Yang and Jiang Wang and Lijuan Wang and Zicheng Liu and Qiang Qiu},
journal= {arXiv preprint arXiv:2411.16713},
year = {2025}
}
备注
WACV 2026