面向通用化指称图像分割:通过目标提示与视觉一致性
计算机视觉与模式识别
2023-12-04 v1
摘要
指称图像分割(RIS)旨在根据自由形式的文本描述分割图像中的物体。尽管取得了巨大进展,当前方法在面对多样文本表达或未见视觉实体时仍难以表现良好,限制了其进一步应用。本文提出一种新颖的 RIS 方法,通过解决上述两个困境显著提升了泛化能力。具体而言,为处理无约束文本,我们提出用显式且关键的提示来增强给定表达,该提示在统一上下文中补充表达,便于在语言风格变化下捕获目标。此外,我们引入一个由强大预训练模型提供视觉引导的多模态融合聚合模块,利用空间关系与像素一致性来处理未见过视觉实体上常出现的不完整目标掩码和假阳性不规则团块。在零样本跨数据集设定下进行了大量实验,所提方法相比 SOTA 取得了一致提升,例如在 RefCOCO、RefCOCO+ 和 ReferIt 上 mIoU 分别提升 4.15%、5.45% 和 4.64%,证明了其有效性。此外,在 GraspNet-RIS 上的结果表明我们的方法也能很好地泛化到具有大领域偏移的新场景。
引用
@article{arxiv.2312.00452,
title = {Towards Generalizable Referring Image Segmentation via Target Prompt and Visual Coherence},
author = {Yajie Liu and Pu Ge and Haoxiang Ma and Shichao Fan and Qingjie Liu and Di Huang and Yunhong Wang},
journal= {arXiv preprint arXiv:2312.00452},
year = {2023}
}
备注
7 pages, 4 figures