从文本到掩码:利用文本到图像扩散模型的注意力定位实体
计算机视觉与模式识别
2024-10-02 v2
摘要
扩散模型近来革新了文本到图像生成领域。其融合文本与图像信息的独特方式促成了生成高度文本相关图像的卓越能力。从另一视角看,这些生成模型隐含了词与像素之间精确关联的线索。本工作提出一种简单而有效的方法,利用文本到图像扩散模型去噪网络中的注意力机制。无需重新训练或推理时优化,即可直接获得短语的语义定位。我们在Pascal VOC 2012与Microsoft COCO 2014上以弱监督语义分割设定评估了我们的方法,其性能优于先前方法。此外,所获取的词-像素关联被发现对定制化生成方法中学到的文本嵌入具有泛化性,仅需少量修改。为验证我们的发现,我们引入了一项称为“个性化指代图像分割”的新实用任务及一个新数据集。在不同情境下的实验展示了我们的方法相较于该任务上强基线方法的优势。总之,我们的工作揭示了一种提取扩散模型中隐藏的丰富多模态知识用于分割的新途径。
引用
@article{arxiv.2309.04109,
title = {From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models},
author = {Changming Xiao and Qi Yang and Feng Zhou and Changshui Zhang},
journal= {arXiv preprint arXiv:2309.04109},
year = {2024}
}
备注
A revised version of this paper will be published in Neurocomputing, see https://doi.org/10.1016/j.neucom.2024.128437