LoGoSeg:融合局部与全局特征的开放词汇语义分割
计算机视觉与模式识别
2026-02-13 v2
摘要
开放词汇语义分割 (OVSS) 扩展了传统封闭集合分割,使其能够使用任意文本描述为见到的类别和未看到的类别进行像素级标注。虽然现有方法利用视觉语言模型 (VLM) 如 CLIP,但依赖图像级预训练常导致空间对齐不精确,在模糊或杂乱场景中产生不匹配的分割结果。然而,大多数现有方法缺乏强对象先验和区域级约束,可能导致对象幻觉或漏检,从而降低性能。为此,我们提出 LoGoSeg,一个高效单阶段框架,集成三项关键创新:(i) 对象存在先验,通过全局图像-文本相似度动态加权相关类别,有效减少幻觉;(ii) 区域感知对齐模块,建立精确的区域级视觉-文本对应;(iii) 双流融合机制,最优组合局部结构信息与全局语义上下文。不同于先前方法,LoGoSeg 无需外部掩码提议、额外主干网络或额外数据集,确保高效。广泛实验表明,其在六大基准测试(A-847、PC-459、A-150、PC-59、PAS-20 和 PAS-20b)上的表现竖争且在开放词汇环境中表现出强鲁棒性。
引用
@article{arxiv.2602.05578,
title = {LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation},
author = {Junyang Chen and Xiangbo Lv and Zhiqiang Kou and Xingdong Sheng and Ning Xu and Yiguo Qiao},
journal= {arXiv preprint arXiv:2602.05578},
year = {2026}
}