中文

开放词汇零样本分割的简单框架

计算机视觉与模式识别 2025-10-16 v3

摘要

零样本分类能力在基于视觉语言对比学习框架训练的模型中自然而然地出现。尽管这些模型在分类方面表现出色,但在密集任务(如零样本开放词汇分割)中却感到困境。这一不足常被归因于标题中缺乏局部化线索以及学习过程中图像表征学习与跨模态对齐的交织性。为解决这些问题,我们提出了 SimZSS(Simple framework for open-vocabulary Zero-Shot Segmentation),即简单框架用于开放词汇零样本分割。该方法基于两个关键原则:i) 利用仅进行文本编码器对齐的冻结视觉模型,这些模型具有空间感知能力;ii) 利用文本和语言知识的离散性,以在标题中定位局部概念。通过借助视觉表征的质量,我们的方法仅需图像-标题配对数据集,并适应小型精选数据集和大规模噪声数据集。当在 COCO Captions 上训练时,SimZSS 在 8 张 GPU 上即可在不到 15 分钟内实现 7/8 个基准数据集的状态提升结果。

关键词

引用

@article{arxiv.2406.16085,
  title  = {A Simple Framework for Open-Vocabulary Zero-Shot Segmentation},
  author = {Thomas Stegmüller and Tim Lebailly and Nikola Dukic and Behzad Bozorgtabar and Tinne Tuytelaars and Jean-Philippe Thiran},
  journal= {arXiv preprint arXiv:2406.16085},
  year   = {2025}
}

备注

ICLR 2025