中文

面向全景叙事定位的冻结文本到图像扩散模型动态提示

计算机视觉与模式识别 2024-09-13 v1

摘要

全景叙事定位(PNG)的核心目标是细粒度的图文对齐,要求在给定叙事描述的情况下对所指代的目标进行全景分割。以往的判别式方法通过全景分割预训练或 CLIP 模型适配仅能实现弱对齐或粗粒度对齐。鉴于文本到图像扩散模型的最新进展,多项工作已证明其能够通过交叉注意力图实现细粒度图文对齐并提升通用分割性能。然而,直接将短语特征作为静态提示应用于冻结的扩散模型以处理 PNG 任务,仍面临巨大的任务差距和不足的视觉-语言交互,导致性能不佳。因此,我们提出在扩散 UNet 内部构建一个提取-注入式短语适配器(EIPA)旁路,利用图像特征动态更新短语提示,并将多模态线索注入回去,从而更充分地利用扩散模型的细粒度图文对齐能力。此外,我们还设计了一个多级相互聚合(MLMA)模块,以双向融合多级图像和短语特征,用于分割细化。在 PNG 基准上的大量实验表明,我们的方法取得了新的 SOTA 性能。

关键词

引用

@article{arxiv.2409.08251,
  title  = {Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding},
  author = {Hongyu Li and Tianrui Hui and Zihan Ding and Jing Zhang and Bin Ma and Xiaoming Wei and Jizhong Han and Si Liu},
  journal= {arXiv preprint arXiv:2409.08251},
  year   = {2024}
}

备注

Accepted by ACM MM 2024