LPOSS:基于图块与像素的标签传播用于开放词汇语义分割
计算机视觉与模式识别
2025-06-26 v2 机器学习
摘要
我们提出了一种使用 Vision-and-Language Models (VLMs) 的开放词汇语义分割免训练方法。我们的方法通过标签传播增强了 VLMs 的初始 per-patch 预测,该传播通过结合图块间关系来联合优化预测。由于 VLMs 主要针对跨模态对齐而非模态内相似性进行优化,我们使用了一种被观察到能更好捕捉这些关系的 Vision Model (VM)。我们通过在像素层面应用标签传播作为细化步骤,解决了基于图块编码器固有的分辨率限制,显著提升了类别边界附近的分割精度。我们的方法称为 LPOSS+,在整个图像上进行推理,避免了基于窗口的处理,从而捕捉整个图像的上下文交互。LPOSS+ 在免训练方法中取得了 state-of-the-art 性能,涵盖多种数据集。代码:https://github.com/vladan-stojnic/LPOSS
引用
@article{arxiv.2503.19777,
title = {LPOSS: Label Propagation Over Patches and Pixels for Open-vocabulary Semantic Segmentation},
author = {Vladan Stojnić and Yannis Kalantidis and Jiří Matas and Giorgos Tolias},
journal= {arXiv preprint arXiv:2503.19777},
year = {2025}
}