面向无需优化 logits 的训练-free 开放词汇语义分割
计算机视觉与模式识别
2026-04-10 v1
摘要
开放词汇语义分割 (OVSS) 旨在使用开放词汇提示对图像中的任意类别区域进行分割, necessitating 现有方法具备像素级视觉语言对齐能力。通常情况下,这种能力涉及计算视觉特征与语言特征之间的余弦相似度(即 logits),并最小化 logits 与真实标记 (GT) 之间的分布差异,以生成最优 logits 从而构建分割图,但这依赖于耗时的迭代训练或模型特定的注意力调制。在本工作中,我们提出了一种更直接的方法,旁离 logits 优化过程,直接推导分割图的解析解。我们假设关键假设:分布差异编码了语义信息;具体而言,这种差异在属于同一类别的 patch 之间呈现一致性,而在不同类别之间呈现不一致性。基于此假设,我们直接利用该分布差异的解析解作为语义图。换言之,我们将分布差异的优化重新表述为求解其解析解,从而消除耗时的迭代训练,摆脱模型特定注意力调制的束缚,并在八个基准数据集上实现最先进的性能。
引用
@article{arxiv.2604.07723,
title = {Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation},
author = {Jiahao Li and Yang Lu and Yachao Zhang and Fangyong Wang and Yuan Xie and Yanyun Qu},
journal= {arXiv preprint arXiv:2604.07723},
year = {2026}
}
备注
Accepted by CVPR 2026