中文

PCA-Seg:重新审视开放词汇语义与部件分割中的成本聚合

计算机视觉与模式识别 2026-03-19 v1

摘要

近期视觉语言模型 (VLM) 的进展在开放词汇语义与部件分割 (OSPS) 领域引起了广泛关注。然而,现有方法通过空间与类别聚合的串行结构从成本体积中提取图像-文本对齐线索,导致类别级语义与空间语境之间的知识相互干扰。因此,本文提出一种简单却有效的并行成本聚合 (PCA-Seg) 范式,以缓解上述挑战,使模型能够从成本体积中捕获更丰富的视觉-语言对齐信息。具体而言,我们设计了一个基于专家驱动的感知学习 (EPL) 模块,高效地整合了语义流和语境流。它包含一个多专家解析器,用于从多个视角提取互补特征。此外,设计了一个系数映射器,用于自适应学习每个特征的像素特定权重,从而将互补知识整合到统一且稳健的特征嵌入中。进一步,我们提出了一种特征正交化解耦 (FOD) 策略,以减轻语义流与语境流之间的冗余,从而使 EPL 模块能够从正交化特征中学习多样化的知识。广泛的实验表明,PCA-Seg 的每个并行模块仅增加 0.35M 参数,却实现了最先进的 OSPS 性能。

关键词

引用

@article{arxiv.2603.17520,
  title  = {PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation},
  author = {Jianjian Yin and Tao Chen and Yi Chen and Gensheng Pei and Xiangbo Shu and Yazhou Yao and Fumin Shen},
  journal= {arXiv preprint arXiv:2603.17520},
  year   = {2026}
}

备注

Accepted by CVPR2026