中文

超越标签:基于视觉语言模型的开放词汇语义分割

计算机视觉与模式识别 2025-07-03 v5

摘要

开放词汇语义分割试图使用任意文本标签(包括训练期间未出现的标签)对图像中的对象进行分类和轮廓化。当有效训练时,自监督学习解决诸多视觉和语言处理问题。本研究旨在调查一种简单且高效的方法,用于适配先前学习的基础模型以完成开放词汇语义分割任务。我们的研究提出了“超越标签”(Beyond-Labels),一种轻量级基于变换器的融合模块,该模块使用少量图像分割数据将冻结的视觉表示与语言概念融合。该策略使模型能够在不需要显著重新训练的情况下利用预训练模型的广泛知识,使方法在数据效率和可扩展性方面都具有优势。此外,我们使用傅里叶嵌入捕获图像中的位置信息,提高了泛化能力,使空间编码更平滑且一致。我们进行了详尽的消融研究,以检验我们提出的方法的主要组件。在标准基准 PASCAL-5i 上,该方法在训练时使用冻结的视觉和语言表示,仍实现了更好的性能。

关键词

引用

@article{arxiv.2501.16769,
  title  = {Beyond-Labels: Advancing Open-Vocabulary Segmentation With Vision-Language Models},
  author = {Muhammad Atta ur Rahman and Dooseop Choi and Seung-Ik Lee and KyoungWook Min},
  journal= {arXiv preprint arXiv:2501.16769},
  year   = {2025}
}

备注

Accepted at the 17th IEEE International Conference on Advanced Computational Intelligence (ICACI 2025)