基于扩散模型注意力图控制的组合式文本到图像合成
计算机视觉与模式识别
2023-12-15 v2
摘要
近期文本到图像(T2I)扩散模型在根据文本提示生成高质量图像方面表现出色。然而,由于其有限的组合能力,它们未能将生成图像与提示进行语义对齐,导致属性泄漏、实体泄漏与实体缺失。本文提出一种基于预测目标框的新型注意力掩码控制策略以解决这些问题。具体而言,我们首先训练一个BoxNet,为提示中具备指定属性的每个实体预测一个框。随后,依据预测框,对交叉注意力与自注意力图施加独特的掩码控制。我们的方法通过将提示中每个词元的注意力区域约束于图像,实现了更具语义准确性的合成。此外,所提方法简洁有效,可便捷集成至现有基于交叉注意力的T2I生成器中。我们将本方法与竞争方法比较,证明其能忠实传达原始文本语义至生成内容,并作为即用插件具备高可用性。请参阅https://github.com/OPPOMente-Lab/attention-mask-control。
引用
@article{arxiv.2305.13921,
title = {Compositional Text-to-Image Synthesis with Attention Map Control of Diffusion Models},
author = {Ruichen Wang and Zekang Chen and Chen Chen and Jian Ma and Haonan Lu and Xiaodong Lin},
journal= {arXiv preprint arXiv:2305.13921},
year = {2023}
}
备注
accept by AAAI2024