中文

ARM:一种用于基于CLIP的开放词汇语义分割的可学习即插即用模块

计算机视觉与模式识别 2026-01-01 v1

摘要

开放词汇语义分割(OVSS)从根本上受到CLIP粗糙的图像级表示的限制,这种表示缺乏精确的像素级细节。现有的免训练方法试图通过引入来自昂贵的外部基础模型(例如SAM、DINO)的先验知识,或通过对CLIP的内部特征应用静态的、手工设计的启发式规则来解决这个问题。这些方法要么计算成本高昂,要么效果次优。我们提出了注意力细化模块(ARM),这是一个轻量级、可学习的模块,能有效解锁并细化CLIP的内部潜力。与静态融合方法不同,ARM学习自适应地融合分层特征。它采用了一个语义引导的交叉注意力块,利用鲁棒的深层特征(K, V)来选择并细化细节丰富的浅层特征(Q),随后是一个自注意力块。其关键创新在于一种“一次训练,随处使用”的范式。ARM在通用数据集(例如COCO-Stuff)上训练一次后,即可作为一个通用的即插即用后处理器,用于各种免训练框架。大量实验表明,ARM在多个基准测试上持续提升了基线性能,且推理开销可忽略不计,为免训练OVSS建立了一种高效且有效的范式。

关键词

引用

@article{arxiv.2512.24224,
  title  = {ARM: A Learnable, Plug-and-Play Module for CLIP-based Open-vocabulary Semantic Segmentation},
  author = {Ziquan Liu and Zhewei Zhu and Xuyang Shi},
  journal= {arXiv preprint arXiv:2512.24224},
  year   = {2026}
}

备注

10 pages, 4 figures