面向弱监督指代表达分割的自适应序列转换器SafaRi
计算机视觉与模式识别
2024-07-03 v1 人工智能
计算与语言
机器学习
多媒体
摘要
指代表达分割(RES)旨在提供图像中由文本(即指代表达)指示的目标对象的分割掩码。现有方法需要大规模的掩码标注,且这些方法在扩展到未见/零样本情境时效果不佳。为解决上述问题,本文提出一种针对RES的弱监督引导架构,并包含若干新的算法创新。到目前为止,我们的方法是首次仅使用部分掩码和框标注(见图1和表1)进行训练。为实现此类低标注设置下的模型原则训练、提高图像-文本区域级对齐并进一步增强目标对象在图像中的空间局部化,我们提出了跨模态注意力一致性模块。为自动为未标记样本生成伪标签,我们引入了基于空间感知零样本提案评分方法的新型掩码有效性过滤程序。大量实验表明,仅使用30%的标注,我们的模型SafaRi在RefCOCO+@testA 和 RefCOCO+testB 数据集上分别实现了59.31和48.26 mIoU,而完全监督的最新SOTA方法SeqTR分别获得58.93和48.19 mIoU。SafaRi在完全监督设置下分别在RefCOCO+testA 和 RefCOCO+testB 上分别超过SeqTR 11.7%和19.6%,并在未见/零样本任务中展现出强大的泛化能力。
引用
@article{arxiv.2407.02389,
title = {SafaRi:Adaptive Sequence Transformer for Weakly Supervised Referring Expression Segmentation},
author = {Sayan Nag and Koustava Goswami and Srikrishna Karanam},
journal= {arXiv preprint arXiv:2407.02389},
year = {2024}
}
备注
Accepted at ECCV 2024