利用扩散模型时空注意力实现高保真文本到图像合成
计算机视觉与模式识别
2023-04-11 v1
摘要
基于扩散的模型在文本到图像合成任务上已取得最先进的性能。然而,这些模型的一个关键局限是生成图像相对于文本描述的保真度低,例如缺失物体、属性不匹配和物体位置错误。造成此类不一致的一个关键原因是文本在空间和 temporal 维度上的交叉注意力不准确:空间维度控制物体应出现在什么像素区域,时间维度控制通过去噪步骤添加不同层次细节的方式。在本文中,我们提出一种新的文本到图像算法,在扩散模型中对时空交叉注意力添加显式控制。我们首先利用布局预测器预测文本中提及物体的像素区域。然后,通过结合对整个文本描述的注意力和对该物体对应像素区域内局部描述的注意力,施加空间注意力控制。进一步通过允许组合权重在每个去噪步骤改变来添加时间注意力控制,并优化组合权重以确保图像与文本间的高保真度。实验表明,我们的方法在无需微调扩散模型的情况下,相较于基于扩散模型的基线生成保真度更高的图像。我们的代码公开于 https://github.com/UCSB-NLP-Chang/Diffusion-SpaceTime-Attn。
引用
@article{arxiv.2304.03869,
title = {Harnessing the Spatial-Temporal Attention of Diffusion Models for High-Fidelity Text-to-Image Synthesis},
author = {Qiucheng Wu and Yujian Liu and Handong Zhao and Trung Bui and Zhe Lin and Yang Zhang and Shiyu Chang},
journal= {arXiv preprint arXiv:2304.03869},
year = {2023}
}
备注
20 pages, 16 figures