利用文本到图像扩散模型探索短语级定位
计算机视觉与模式识别
2024-07-09 v1 多媒体
摘要
近年来,扩散模型在视觉理解方面日益展现出其能力。通过利用基于提示的学习来构建句子,这些模型在分类和视觉定位任务中表现出色。然而,现有方法主要展示了它们在句子级定位方面的能力,而利用上下文信息进行短语级理解的潜力在很大程度上尚未被探索。在本文中,我们利用全景叙事定位(PNG)作为代理任务来进一步研究这一能力。PNG旨在分割给定叙事文本中多个名词短语所提及的对象实例。具体来说,我们引入了DiffPNG框架,这是一种直接而有效的方法,通过将分割过程分解为定位、分割和细化步骤序列,充分利用了扩散架构进行分割。该框架首先使用交叉注意力机制识别锚点,随后使用自注意力机制执行分割,以实现零样本PNG。此外,我们引入了一个基于SAM的细化模块来提升分割掩码的质量。我们在PNG数据集上的大量实验表明,DiffPNG在零样本PNG任务设置中取得了强劲的性能,确凿地证明了扩散模型在上下文感知的短语级理解方面的能力。源代码可在\url{https://github.com/nini0919/DiffPNG}获取。
引用
@article{arxiv.2407.05352,
title = {Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model},
author = {Danni Yang and Ruohan Dong and Jiayi Ji and Yiwei Ma and Haowei Wang and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2407.05352},
year = {2024}
}
备注
Accepted by ECCV2024