RESMatch: Referring Expression Segmentation in a Semi-Supervised Manner
计算机视觉与模式识别
2024-02-13 v2
摘要
指代表达分割(RES)是一种涉及根据自由形式语言描述局部特定实例级对象的方法,该任务已成为人机交互的关键前沿。它需要对视觉和文本语境进行复杂的理解,往往需要大量训练数据。本文介绍了 RESMatch,即首个针对 RES 的半监督学习(SSL)方法,旨在减少对详尽数据标注的依赖。在多个 RES 数据集上进行的广泛验证表明,RESMatch显著优于基线方法,建立了新的状态水平。虽然现有 SSL 技术在图像分割中有效,但我们发现其在 RES 中不足。面对包括对自由形式语言描述的理解以及对象属性变化等挑战,RESMatch 引入了三方面的改进:修订的强扰动、文本增强以及伪标签质量和强弱监督的调整。该 pioneering work 为未来在指代表达分割上进行半监督学习的研究奠定了基础。
引用
@article{arxiv.2402.05589,
title = {RESMatch: Referring Expression Segmentation in a Semi-Supervised Manner},
author = {Ying Zang and Chenglong Fu and Runlong Cao and Didi Zhu and Min Zhang and Wenjun Hu and Lanyun Zhu and Tianrun Chen},
journal= {arXiv preprint arXiv:2402.05589},
year = {2024}
}