增强文本到图像合成中的语义保真度:扩散模型中的注意力调节
计算机视觉与模式识别
2024-03-12 v1
摘要
扩散模型的最新进展显著提高了文本到图像合成任务中生成图像的感知质量。然而,扩散模型常常难以生成准确反映相关文本提示预期语义的图像。我们检查了扩散模型中的交叉注意力层,并观察到这些层在生成过程中倾向于不成比例地关注某些 token,从而破坏了语义保真度。为了解决主导注意力的问题,我们引入了注意力调节,这是一种在推理时进行的计算高效的即时优化方法,旨在使注意力图与输入文本提示对齐。值得注意的是,我们的方法不需要额外的训练或微调,并可作为模型上的即插即用模块。因此,原始模型的生成能力得到了完全保留。我们将我们的方法与各种数据集、评估指标和扩散模型上的替代方法进行了比较。实验结果表明,我们的方法始终优于其他基线,生成的图像能更忠实地反映所需概念,且计算开销更低。代码可在 https://github.com/YaNgZhAnG-V5/attention_regulation 获取。
引用
@article{arxiv.2403.06381,
title = {Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models},
author = {Yang Zhang and Teoh Tze Tzun and Lim Wei Hern and Tiviatis Sim and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2403.06381},
year = {2024}
}