MaIL:一种用于指代图像分割的统一掩码-图像-语言三模态网络
计算机视觉与模式识别
2021-11-29 v2
摘要
指代图像分割是一项典型的多模态任务,旨在为给定语言表达式中所描述的目标生成二值掩码。已有方法采用双模态方案,在编码器-融合-解码器流程中将图像与语言作为两种模态。然而,该流程对目标任务而言是次优的,原因有二。首先,它们仅融合由单模态编码器分别产生的高层特征,阻碍了充分的跨模态学习。其次,单模态编码器独立预训练,导致预训练单模态任务与目标多模态任务间的不一致。此外,该流程常忽略或极少利用直观有益的实例级特征。为缓解这些问题,我们提出 MaIL,这是一种更简洁的编码器-解码器流程,带有掩码-图像-语言三模态编码器。具体而言,MaIL 将单模态特征提取器及其融合模型统一为深度模态交互编码器,促进不同模态间充分的特征交互。同时,MaIL 因不再需要单模态编码器而直接避免了第二点局限。而且,我们首次提出引入实例掩码作为附加模态,显式强化实例级特征并促成更精细的分割结果。所提 MaIL 在所有常用指代图像分割数据集(包括 RefCOCO、RefCOCO+ 与 G-Ref)上确立了新的 SOTA,相较先前最佳方法取得 3%–10% 的显著增益。代码即将发布。
引用
@article{arxiv.2111.10747,
title = {MaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image Segmentation},
author = {Zizhang Li and Mengmeng Wang and Jianbiao Mei and Yong Liu},
journal= {arXiv preprint arXiv:2111.10747},
year = {2021}
}