中文

CMF:用于指称图像分割的级联多模型融合

计算机视觉与模式识别 2021-06-17 v1

摘要

在本文中,我们处理指称图像分割(RIS)任务,其目标是为自然语言表达式所描述的对象预测分割掩码。大多数现有方法侧重于建立视觉与语言特征之间的单向或有向关系以关联两种模态,而多尺度上下文被忽略或建模不足。多尺度上下文对于在多模态融合过程中定位并分割那些具有大尺度变化的对象至关重要。为解决该问题,我们提出一种简单而有效的级联多模态融合(CMF)模块,其并行堆叠多个空洞卷积层,并进一步引入级联分支来融合视觉与语言特征。该级联分支能逐步整合多尺度上下文信息,并在多模态融合过程中促进两种模态的对齐。在四个基准数据集上的实验结果表明,我们的方法优于大多数最先进方法。代码见 https://github.com/jianhua2022/CMF-Refseg。

关键词

引用

@article{arxiv.2106.08617,
  title  = {CMF: Cascaded Multi-model Fusion for Referring Image Segmentation},
  author = {Jianhua Yang and Yan Huang and Zhanyu Ma and Liang Wang},
  journal= {arXiv preprint arXiv:2106.08617},
  year   = {2021}
}

备注

Accepted by ICIP 2021