中文

关注邻域:无需训练的开放词汇语义分割

计算机视觉与模式识别 2024-09-18 v2

摘要

尽管深度学习在密集视觉识别问题(如语义分割)方面取得了显著进展,但传统方法仍受限于固定的类别集合。同时,视觉-语言基础模型(如 CLIP)凭借其强大的泛化能力,在众多零样本图像级任务中展现出了卓越的有效性。近期,一系列工作研究了将这些模型应用于开放词汇语义分割(OVSS)。然而,现有方法通常依赖于不切实际的监督预训练或需要访问额外的预训练网络。在本工作中,我们提出了一种无需训练的 OVSS 强基线方法,称为 Neighbour-Aware CLIP (NACLIP),该方法是对 CLIP 专为该场景设计的直接适配。我们的方法在 CLIP 视觉 Transformer 的自注意力中强制实施 patch 的局部化,尽管这对于密集预测任务至关重要,但在 OVSS 文献中一直被忽视。通过引入有利于分割的设计选择,我们的方法在不需要额外数据、辅助预训练网络或大量超参数调整的情况下显著提升了性能,使其在实际应用中具有极高的实用性。实验在 8 个流行的语义分割基准上进行,在大多数场景下取得了 SOTA 的性能。我们的代码已在 https://github.com/sinahmr/NACLIP 公开。

关键词

引用

@article{arxiv.2404.08181,
  title  = {Pay Attention to Your Neighbours: Training-Free Open-Vocabulary Semantic Segmentation},
  author = {Sina Hajimiri and Ismail Ben Ayed and Jose Dolz},
  journal= {arXiv preprint arXiv:2404.08181},
  year   = {2024}
}

备注

Accepted to WACV 2025