基于自适应跨注意力融合的可控布局文本-对象合成
计算机视觉与模式识别
2024-11-27 v4 人工智能
摘要
可控文本到图像生成合成图像中的视觉文本与对象,常用于 emoji 与海报生成。视觉文本渲染与布局到图像生成任务在可控文本到图像生成中备受推崇。然而,这些任务通常仅聚焦于单一模态的生成或渲染,留下了相应方法之间尚未桥接的鸿沟。本文将文本渲染与布局到图像生成任务融合为单一任务:布局可控文本-对象合成(LTOS)任务,旨在基于预定义的对象布局和文本内容合成具有对象与视觉文本的图像。由于缺乏适用于 LTOS 任务的合规数据集,我们构建了一个布局感知文本-对象合成数据集,包含精心对齐的视觉文本与对象信息。基于该数据集,我们提出一种布局可控文本-对象自适应融合(TOF)框架,生成清晰、可读的视觉文本与合理的对象。我们构建了视觉文本渲染模块以合成文本,并采用对象布局控制模块生成对象,同时将两个模块整合在一起和谐地生成和集成图像中的文本内容与对象。为更好地实现图像-文本集成,我们提出一种自适应跨注意力融合模块,帮助图像生成更关注重要的文本信息。在该融合模块中,我们使用自适应可学习因子来学习灵活控制跨注意力输出对图像生成的影响。实验结果表明,我们的方法在 LTOS、文本渲染和布局到图像任务中均优于 state-of-the-art 方法,实现了视觉文本渲染与对象生成的和谐统一。
引用
@article{arxiv.2404.13579,
title = {LTOS: Layout-controllable Text-Object Synthesis via Adaptive Cross-attention Fusions},
author = {Xiaoran Zhao and Tianhao Wu and Yu Lai and Zhiliang Tian and Zhen Huang and Yahui Liu and Zejiang He and Dongsheng Li},
journal= {arXiv preprint arXiv:2404.13579},
year = {2024}
}