中文

面向快速开放词汇分割的全局知识校准

计算机视觉与模式识别 2023-07-18 v2

摘要

预训练视觉-语言模型(如 CLIP)的最新进展使得仅通过文本输入即可分割任意概念,这一过程通常被称为开放词汇语义分割(OVS)。然而,现有 OVS 技术面临一个根本挑战:训练后的分类器倾向于过拟合于训练期间观察到的基类,导致对未见类的泛化性能欠佳。为缓解该问题,近期研究提出使用额外的冻结预训练 CLIP 进行分类。但此方法带来沉重计算开销,因为 CLIP 视觉编码器必须对每个掩码重复前向传播,使其难以在实际应用中部署。为应对该挑战,我们的目标是开发一种快速 OVS 模型,其在推理时无需 CLIP 图像编码器的额外计算负担即可取得相当或更优性能。为此,我们提出在已知类上微调时保留可泛化表示的核心思路。具体而言,我们引入文本多样化策略,为每个训练类别生成一组同义词,以防止学习到的表示坍缩到特定已知类别名称上。此外,我们采用文本引导的知识蒸馏方法来保留 CLIP 的可泛化知识。大量实验表明,我们所提模型在各数据集上均实现了鲁棒泛化性能。进一步地,我们对开放词汇视频分割进行了初步探索,并给出了一个可促进视频域开放词汇研究的基准。

关键词

引用

@article{arxiv.2303.09181,
  title  = {Global Knowledge Calibration for Fast Open-Vocabulary Segmentation},
  author = {Kunyang Han and Yong Liu and Jun Hao Liew and Henghui Ding and Yunchao Wei and Jiajun Liu and Yitong Wang and Yansong Tang and Yujiu Yang and Jiashi Feng and Yao Zhao},
  journal= {arXiv preprint arXiv:2303.09181},
  year   = {2023}
}

备注

Accepted by ICCV2023