中文

用于开放词汇分割的泛化增强适配器

计算机视觉与模式识别 2024-09-16 v1

摘要

视觉-语言模型 (VLMs) 展现出卓越的开放词汇目标识别能力,促使人们将其适配至分割等密集预测任务。然而,由于缺乏像素级粒度且可用于微调的数据有限,直接将 VLMs 应用于此类任务仍具挑战性,易导致过拟合并降低泛化能力。为解决这些局限性,我们提出了泛化增强适配器 (GBA),这是一种新颖的适配器策略,旨在增强 VLMs 在开放词汇分割中的泛化能力和鲁棒性。GBA 包含两个核心组件:(1) 风格多样化适配器 (SDA),将特征解耦为幅度和相位分量,仅对幅度进行操作以丰富特征空间表示,同时保持语义一致性;(2) 相关性约束适配器 (CCA),采用交叉注意力在文本类别与目标区域之间建立更紧密的语义关联,抑制无关的低频“噪声”信息并避免错误关联。通过浅层 SDA 与深层 CCA 的协同作用,GBA 有效缓解了过拟合问题并增强了特征表示的语义相关性。作为一种简单、高效且即插即用的组件,GBA 可灵活集成至各种基于 CLIP 的方法中,展现出广泛的适用性并在多个开放词汇分割基准上取得 SOTA 性能。

关键词

引用

@article{arxiv.2409.08468,
  title  = {Generalization Boosted Adapter for Open-Vocabulary Segmentation},
  author = {Wenhao Xu and Changwei Wang and Xuxiang Feng and Rongtao Xu and Longzhao Huang and Zherui Zhang and Li Guo and Shibiao Xu},
  journal= {arXiv preprint arXiv:2409.08468},
  year   = {2024}
}