GLIGEN:开放集接地文本到图像生成
计算机视觉与模式识别
2023-04-18 v2 人工智能
计算与语言
图形学
机器学习
摘要
大规模文本到图像扩散模型取得了惊人的进展。然而,现状是仅使用文本输入,这可能妨碍可控性。在这项工作中,我们提出 GLIGEN(Grounded-Language-to-Image Generation,接地语言到图像生成),一种建立在现有预训练文本到图像扩散模型之上并扩展其功能的新方法,使其也能够以接地输入为条件。为了保留预训练模型的广泛概念知识,我们冻结其所有权重,并通过门控机制将接地信息注入到新的可训练层中。我们的模型以标题和边界框条件输入实现了开放世界接地文本到图像(text2img)生成,并且接地能力对新颖的空间配置和概念具有良好的泛化性。GLIGEN 在 COCO 和 LVIS 上的零样本性能大幅优于现有的有监督布局到图像基线。
引用
@article{arxiv.2301.07093,
title = {GLIGEN: Open-Set Grounded Text-to-Image Generation},
author = {Yuheng Li and Haotian Liu and Qingyang Wu and Fangzhou Mu and Jianwei Yang and Jianfeng Gao and Chunyuan Li and Yong Jae Lee},
journal= {arXiv preprint arXiv:2301.07093},
year = {2023}
}