超越一对一:重新思考指称图像分割
计算机视觉与模式识别
2023-08-29 v1
摘要
指称图像分割旨在分割由自然语言表达式所指的目标物体。然而,以往方法依赖于“一个句子必须描述图像中一个目标”的强假设,而现实应用中往往并非如此。因此,当表达式指代零个或多个物体时,此类方法失效。本文从两个角度解决该问题。首先,我们提出双多模态交互(DMMI)网络,其包含两个解码器分支并支持双向信息流。在文本到图像解码器中,文本嵌入用于查询视觉特征并定位对应目标;同时,图像到文本解码器基于视觉特征重建被擦除的实体短语。以此方式,视觉特征被促使包含关于目标实体的关键语义信息,进而支持文本到图像解码器中的精确分割。其次,我们收集了一个名为 Ref-ZOM 的更具挑战性但更真实的数据集,包含不同设定下的图像-文本对。大量实验表明,我们的方法在不同数据集上均达到最先进(SOTA)性能,且 Ref-ZOM 训练的模型在各类文本输入上表现良好。代码与数据集见 https://github.com/toggle1995/RIS-DMMI。
引用
@article{arxiv.2308.13853,
title = {Beyond One-to-One: Rethinking the Referring Image Segmentation},
author = {Yutao Hu and Qixiong Wang and Wenqi Shao and Enze Xie and Zhenguo Li and Jungong Han and Ping Luo},
journal= {arXiv preprint arXiv:2308.13853},
year = {2023}
}
备注
ICCV 2023