PPMN:面向单阶段全景叙事定位的像素-短语匹配网络
计算机视觉与模式识别
2022-08-12 v1 多媒体
摘要
全景叙事定位(PNG)是一项新兴任务,其目标是对静态图像由稠密叙事描述所刻画的物体与物质类视觉对象进行分割。此前的两阶段方法首先通过现成的全景分割模型提取分割区域提议,然后对每个名词短语进行粗粒度的区域-短语匹配以定位候选区域。然而,两阶段流程通常受限于第一阶段低质量提议的性能瓶颈,以及区域特征池化导致的空间细节丢失,还有为物体和物质类别分别设计的复杂策略。为缓解这些缺陷,我们提出一种单阶段端到端像素-短语匹配网络(PPMN),其直接将每个短语与其对应像素而非区域提议匹配,并通过简单组合输出全景分割。因此,我们的模型可利用稠密标注的像素-短语对而非稀疏的区域-短语对所提供的充足且更精细的跨模态语义对应。此外,我们还提出语言兼容像素聚合(LCPA)模块,通过多轮精炼进一步增强短语特征的判别能力,其为每个短语选取最兼容的像素以自适应聚合相应的视觉上下文。大量实验表明,我们的方法在 PNG 基准上以 4.0 的绝对平均召回率增益取得了新的最优性能。
引用
@article{arxiv.2208.05647,
title = {PPMN: Pixel-Phrase Matching Network for One-Stage Panoptic Narrative Grounding},
author = {Zihan Ding and Zi-han Ding and Tianrui Hui and Junshi Huang and Xiaoming Wei and Xiaolin Wei and Si Liu},
journal= {arXiv preprint arXiv:2208.05647},
year = {2022}
}
备注
Accepted by ACM MM 2022