中文

用于指代分割的跨模态渐进理解

计算机视觉与模式识别 2021-05-18 v1 多媒体

摘要

给定自然语言表达式与图像/视频,指代分割的目标是生成由表达式主语所描述的实体的像素级掩码。以往方法以单阶段方式通过视觉与语言模态间的隐式特征交互与融合来解决该问题。然而,人类倾向于基于表达式中的信息词以渐进方式解决指代问题,即先粗略定位候选实体,再区分目标实体。本文中,我们提出跨模态渐进理解(CMPC)方案以有效模拟人类行为,并将其实现为 CMPC-I(图像)模块与 CMPC-V(视频)模块,以改进指代图像与视频分割模型。对于图像数据,我们的 CMPC-I 模块首先利用实体词与属性词感知表达式可能考虑的所有相关实体;随后,采用关系词通过空间图推理突出目标实体并抑制其他无关实体。对于视频数据,我们的 CMPC-V 模块在 CMPC-I 基础上进一步利用动作词,通过时序图推理突出与动作线索匹配的正确实体。除 CMPC 外,我们还引入一个简洁而有效的文本引导特征交换(TGFE)模块,在文本信息引导下整合视觉骨干网络中不同层级对应的推理多模态特征。如此,多级特征可相互通信并基于文本上下文相互精炼。将 CMPC-I 或 CMPC-V 与 TGFE 结合可构成我们的图像或视频版指代分割框架,且我们的框架在四个指代图像分割基准与三个指代视频分割基准上分别取得新的最先进性能。

关键词

引用

@article{arxiv.2105.07175,
  title  = {Cross-Modal Progressive Comprehension for Referring Segmentation},
  author = {Si Liu and Tianrui Hui and Shaofei Huang and Yunchao Wei and Bo Li and Guanbin Li},
  journal= {arXiv preprint arXiv:2105.07175},
  year   = {2021}
}

备注

Accepted by TPAMI 2021