中文

PEARL:几何对语义进行对齐,实现无需训练的开放词汇语义分割

计算机视觉与模式识别 2026-03-24 v1

摘要

无需训练的开放词汇语义分割(OVSS)承诺能够快速适应新的标签集合,无需重新训练。然而,许多方法依赖重型后处理或将文本和视觉处理为孤立,从而未充分利用跨模态几何。其他方法则引入辅助视觉主干网络或多模型管道,这增加了复杂度和延迟,同时损害设计的简单性。我们提出了 PEARL(Procrustes Alignment with text-aware Laplacian propagation),一种紧凑的两步推理方法,遵循“对齐后传播”原则。Procrustes 对齐步骤在最后的自注意力块内部执行正交投影,通过稳定的极坐标迭代将查询子空间中的键旋转。文本感知的拉普拉斯传播随后通过置信度加权的、受文本引导的图求解,对小网格上的每个像素的 logits 进行细化:文本既提供数据可信信号,又提供邻居门控,而图像梯度则保留边界。本文中,我们的方法完全无需训练、即插即用,仅使用固定常数,额外延迟极小,仅需少量投影和几次共轭梯度步骤。我们的做法 PEARL 在无额外数据或辅助主干网络的情况下,跨越标准基准,实现了训练-free OVSS 的新型状态,在带背景和不带背景协议下均表现优异。

关键词

引用

@article{arxiv.2603.21528,
  title  = {PEARL: Geometry Aligns Semantics for Training-Free Open-Vocabulary Semantic Segmentation},
  author = {Gensheng Pei and Xiruo Jiang and Xinhao Cai and Tao Chen and Yazhou Yao and Byeungwoo Jeon},
  journal= {arXiv preprint arXiv:2603.21528},
  year   = {2026}
}

备注

accepted by CVPR 2026