通过交叉注意力控制实现免训练的局部化文本到图像生成
计算机视觉与模式识别
2023-06-27 v1
摘要
尽管文本到图像生成模型取得了巨大成功,局部化文本到图像生成(即在图像特定位置生成物体或特征,同时保持整体生成的一致性)仍需要显式训练或大量额外的推理时间。在本工作中,我们表明局部化生成可以通过在推理过程中简单地控制交叉注意力图来实现。无需额外训练、模型架构修改或推理时间,我们提出的交叉注意力控制(CAC)为标准文本到图像模型提供了新的开放词汇定位能力。CAC 在推理时部署时也能增强已经为局部化生成训练过的模型。此外,为了自动评估局部化文本到图像生成性能,我们利用大型预训练识别模型开发了一套标准化的评估方案。我们的实验表明,CAC 在使用从边界框到语义分割图的各种位置信息时均能改善局部化生成性能,并增强了最先进文本到图像生成模型的组合能力。
引用
@article{arxiv.2306.14636,
title = {Localized Text-to-Image Generation for Free via Cross Attention Control},
author = {Yutong He and Ruslan Salakhutdinov and J. Zico Kolter},
journal= {arXiv preprint arXiv:2306.14636},
year = {2023}
}