中文

基于非配对掩码-文本监督的开放词汇分割

计算机视觉与模式识别 2024-06-12 v2 人工智能

摘要

当前最先进的开放词汇分割方法通常依赖图像-掩码-文本三元组标注进行监督。然而,获取如此详细的标注是劳动密集型的,并且在复杂的现实场景中面临可扩展性挑战。虽然现有的弱监督方法利用图像-文本对来降低高昂的标注成本,但掩码监督的缺乏使得模型难以定位多个实例并准确地将具有相似语义的像素分组,严重阻碍了通用性和性能。在本文中,我们引入了 Unpair-Seg,这是一种新颖的弱监督开放词汇分割框架,它从非配对的图像-掩码和图像-文本对中学习,这些数据对可以独立且高效地收集。Unpair-Seg 首先预测一组二值掩码,并通过识别置信的掩码与文本实体对来生成伪标签。然后,我们训练一个特征适配器,基于这些伪标签将区域嵌入与文本嵌入对齐,从而实现开放词汇分割。然而,掩码-实体对应关系中的固有噪声对获取可靠对构成了挑战。为了解决这个问题,我们采用了一个视觉-语言大模型来重新描述输入图像并提取精确的实体,并设计了一种多尺度匹配策略来减少噪声掩码-实体对。我们的 Unpair-Seg 框架展示了令人印象深刻的性能,在 ADE-847 和 PASCAL Context-459 数据集上分别达到了 14.6% 和 19.5% 的 mIoU,显著缩小了全监督和弱监督方法之间的差距。

关键词

引用

@article{arxiv.2402.08960,
  title  = {Open-Vocabulary Segmentation with Unpaired Mask-Text Supervision},
  author = {Zhaoqing Wang and Xiaobo Xia and Ziye Chen and Xiao He and Yandong Guo and Mingming Gong and Tongliang Liu},
  journal= {arXiv preprint arXiv:2402.08960},
  year   = {2024}
}

备注

27 pages, 18 figures, 10 tables