面向弱监督指代图像分割的课程点提示
计算机视觉与模式识别
2024-04-19 v1
摘要
指代图像分割旨在通过相应的自然语言表达式对图像中的指代对象进行精确分割,但依赖于高成本的掩码标注。弱监督的指代图像分割通过图像-文本对学习像素级语义,这在对细粒度掩码进行分割方面具有挑战性。增加分割精度的自然方法是让弱监督的指代图像分割利用图像分割基础模型SAM。然而,我们观察到仅仅集成SAM会带来有限的益处,甚至可能导致性能下降,因为噪声问题以及对对象部件的过度关注是不可避免的。本文提出了一种创新框架——点提示(PPT),并纳入提出的多源课程学习策略以解决这些挑战。具体而言,PPT的核心是一个点生成器,不仅利用CLIP的文本-图像对齐能力和SAM的强大掩码生成能力,还生成负点提示,以有效且根本性地解决噪声和过度关注问题。此外,我们引入一种以对象为中心的图像的课程学习策略,帮助PPT逐渐从更简单但更精确的语义对齐学习到更复杂的指代图像分割。实验表明,与先前的弱监督技术相比,PPT在RefCOCO、RefCOCO+和G-Ref上的mIoU分别提高了11.34%、14.14%和6.97%。
引用
@article{arxiv.2404.11998,
title = {Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation},
author = {Qiyuan Dai and Sibei Yang},
journal= {arXiv preprint arXiv:2404.11998},
year = {2024}
}
备注
Accepted to CVPR 2024