中文

通过耦合像素与物体上下文丰富短语特征的全景叙事定位

计算机视觉与模式识别 2024-03-12 v2

摘要

全景叙事定位(PNG)旨在对图像中由叙事性描述的名词短语所指的事物(things)和材质(stuff)对象进行分割。作为一个多模态任务,PNG的一个关键方面是图像与描述之间的视觉-语言交互。先前的两阶段方法从离线生成的掩码提议中聚合视觉上下文至短语特征,往往带有噪声且碎片化。近期的一阶段方法仅从图像特征向短语特征聚合像素上下文,可能因缺乏物体先验而导致语义错位。为实现更全面的视觉-语言交互,我们提出通过设计短语-像素-物体Transformer解码器(PPO-TD)以耦合的像素与物体上下文丰富短语特征,其中细粒度部件细节与粗粒度实体线索均被聚合至短语特征。此外,我们还提出短语-物体对比损失(POCL),以拉近匹配的短语-物体对、推远不匹配的对,从而从更具短语相关性的物体令牌中聚合更精确的物体上下文。在PNG基准上的大量实验表明,我们的方法以显著优势取得新最先进的性能。

关键词

引用

@article{arxiv.2311.01091,
  title  = {Enriching Phrases with Coupled Pixel and Object Contexts for Panoptic Narrative Grounding},
  author = {Tianrui Hui and Zihan Ding and Junshi Huang and Xiaoming Wei and Xiaolin Wei and Jiao Dai and Jizhong Han and Si Liu},
  journal= {arXiv preprint arXiv:2311.01091},
  year   = {2024}
}

备注

Accepted by IJCAI 2023. Since the PNG benchmark adopts a different data partition manner from ours, we update the experimental results on the things/stuff/singulars/plurals subsets based on the PNG's code