基于布局桥接的文本到图像合成
计算机视觉与模式识别
2022-08-15 v1
摘要
文本到图像合成的核心难点在于保持输入文本与合成图像之间的跨模态语义一致性。典型方法直接建模文本到图像的映射,只能捕捉文本中指示常见物体或动作的关键词,却无法学习其空间分布模式。规避该限制的一种有效方式是生成图像布局作为引导,已有少数方法尝试此举。然而,这些方法因输入文本与物体位置的多样性而未能生成切实有效的布局。本文致力于在文本到布局生成与布局到图像合成两阶段均实现有效建模。具体而言,我们将文本到布局生成表述为序列到序列建模任务,并基于 Transformer 构建模型,通过建模物体间的序列依赖来学习其空间关系。在布局到图像合成阶段,我们聚焦于学习布局中每个物体的文本–视觉语义对齐,以将输入文本精确融入布局到图像合成过程。为评估生成布局的质量,我们专门设计了一种新指标,称为布局质量分数(Layout Quality Score),其同时考虑布局中边界框的绝对分布误差及它们之间的相互空间关系。在三个数据集上的大量实验表明,我们的方法在给定文本预测布局与合成图像方面均优于最先进的方法。
关键词
引用
@article{arxiv.2208.06162,
title = {Layout-Bridging Text-to-Image Synthesis},
author = {Jiadong Liang and Wenjie Pei and Feng Lu},
journal= {arXiv preprint arXiv:2208.06162},
year = {2022}
}