缓解对象偏差和区域到文本错位问题:面向开放词汇全景分割的 OVRCOAT 框架
计算机视觉与模式识别
2026-03-24 v1
摘要
开放词汇全景分割受阻于两个耦合问题:(i)掩码选择偏差,其中基于封闭词汇训练的对象性头部抑制了训练中未观察到的类别的掩码;(ii)视觉语言模型如 CLIP 中区域理解有限,这些模型为全局图像分类而非局部分割优化。我们引入 OVRCOAT,一个简单、模块化的框架,同时解决这两个问题。首先,CLIP 条件化对象性调整(COAT)更新背景/前景概率,保留针对未词汇对象高质量掩码的能力。其二,开放词汇掩码到文本细化(OVR)强化 CLIP 的区域级对齐,以改善 seen 和 unseen 类别的分类,显著降低内存开销于先前微调方案。两个组件组合在内,联合改善对象性估计和掩码识别,实现持续的全景提升。尽管方法简单,OVRCOAT 在 ADE20K 上(+5.5% PQ)实现了新的最佳成绩,并在 Mapillary Vistas 和 Cityscapes 上 (+7.1% 和 +3% PQ) 取得明显提升。代码可在 https://github.com/nickormushev/OVRCOAT 获取。
引用
@article{arxiv.2603.21386,
title = {Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation},
author = {Nikolay Kormushev and Josip Šarić and Matej Kristan},
journal= {arXiv preprint arXiv:2603.21386},
year = {2026}
}