面向全监督的指代表达式分割
计算机视觉与模式识别
2023-11-28 v2
摘要
指代表达式分割(RES)是计算机视觉中一项新兴任务,其根据文本描述分割图像中的目标实例。然而,其发展受困于昂贵的分割标签。为解决此问题,我们提出了一种称为全监督指代表达式分割(Omni-RES)的 RES 新学习任务,旨在充分利用无标签、全标签与弱标签数据(如指代点或定位框)以高效训练 RES。为完成该任务,我们还基于近期流行的师生学习提出了一种新颖且强大的 Omni-RES 基线方法,其中弱标签不直接转化为监督信号,而是用作标尺来筛选并精炼高质量伪掩码以用于师生学习。为验证所提 Omni-RES 方法,我们将其应用于一组最先进的 RES 模型,并在多个 RES 数据集上进行了广泛实验。实验结果展现出 Omni-RES 相比全监督与半监督训练方案的明显优势。例如,仅使用 10% 全标签数据,Omni-RES 即可帮助基础模型达到 100% 全监督性能,并且大幅优于半监督替代方案,在 RefCOCO 与 RefCOCO+ 上分别提升 +14.93% 与 +14.95%。更重要的是,Omni-RES 还支持使用如 Visual Genome 等大规模视觉-语言数据以促进低成本 RES 训练,并取得 RES 的新 SOTA 性能,例如在 RefCOCO 上达到 80.66。
引用
@article{arxiv.2311.00397,
title = {Towards Omni-supervised Referring Expression Segmentation},
author = {Minglang Huang and Yiyi Zhou and Gen Luo and Guannan Jiang and Weilin Zhuang and Xiaoshuai Sun},
journal= {arXiv preprint arXiv:2311.00397},
year = {2023}
}