中文

上下文至关重要:基于可变形注意力精炼匹配网络的端到端全景叙事指代分割

计算机视觉与模式识别 2023-10-26 v1 计算与语言

摘要

全景叙事指代分割(PNG)是一项新兴的视觉指代任务,旨在基于稠密叙事描述对图像中的视觉对象进行分割。当前最先进的方法首先通过聚合最相似的 kk 个图像像素来精炼短语的表示,然后将精炼后的文本表示与图像特征图的像素匹配以生成分割结果。然而,简单地聚合采样的图像特征忽略了上下文信息,可能导致短语到像素的错配。在本文中,我们提出一种称为可变形注意力精炼匹配网络(DRMN)的新颖学习框架,其主要思想是在特征学习的迭代过程中引入可变形注意力,以融入不同尺度像素的关键上下文信息。DRMN 在更新前 kk 个最相似像素的特征表示后,利用可变形注意力网络对像素进行迭代重编码。由此,DRMN 可得到准确且具判别力的像素表示,纯化前 kk 个最相似像素,从而大幅缓解短语到像素的错配。实验结果表明,我们的新颖设计显著改善了文本短语与图像像素间的匹配结果。具体而言,DRMN 在 PNG 基准上以平均召回率提升 3.5% 取得了新的最先进性能。代码见:https://github.com/JaMesLiMers/DRMN。

关键词

引用

@article{arxiv.2310.16616,
  title  = {Context Does Matter: End-to-end Panoptic Narrative Grounding with Deformable Attention Refined Matching Network},
  author = {Yiming Lin and Xiao-Bo Jin and Qiufeng Wang and Kaizhu Huang},
  journal= {arXiv preprint arXiv:2310.16616},
  year   = {2023}
}

备注

Accepted by ICDM 2023