用于指代图像分割的掩码基座化
计算机视觉与模式识别
2024-03-26 v2
摘要
指代图像分割 (RIS) 是一项具有挑战性的任务,要求算法分割由自由形式语言表达所指代的物体。尽管近年来取得了显著进展,但大多数最先进 (SOTA) 方法在像素和单词层面仍遭受严重的语言 - 图像模态差距。这些方法通常 1) 依赖句子级语言特征进行语言 - 图像对齐,2) 缺乏针对细粒度视觉基座化的显式训练监督。因此,它们在视觉和语言特征之间表现出微弱的物体级对应关系。如果没有良好基座化的特征,先前的方法难以理解需要在多个物体之间的关系上进行强推理的复杂表达,尤其是在处理罕见或模糊的从句时。为了应对这一挑战,我们引入了一种新颖的掩码基座化 (Mask Grounding) 辅助任务,通过显式教导模型学习被掩码的文本标记与其匹配的视觉物体之间的细粒度对应关系,显著改善了语言特征内的视觉基座化。掩码基座化可直接用于先前的 RIS 方法并持续带来改进。此外,为了全面解决模态差距,我们还设计了一个跨模态对齐损失及其配套的对齐模块。这些补充与掩码基座化协同工作。凭借所有这些技术,我们的综合方法 culminates 在 MagNet (Mask-grounded Network) 架构中,该架构在三个关键基准测试 (RefCOCO、RefCOCO+ 和 G-Ref) 上显著优于现有技术,证明了我们的方法在解决当前 RIS 算法局限性方面的有效性。我们的代码和预训练权重将发布。
引用
@article{arxiv.2312.12198,
title = {Mask Grounding for Referring Image Segmentation},
author = {Yong Xien Chng and Henry Zheng and Yizeng Han and Xuchong Qiu and Gao Huang},
journal= {arXiv preprint arXiv:2312.12198},
year = {2024}
}
备注
Accepted by CVPR2024; Project page: https://yxchng.github.io/projects/mask-grounding