中文

基于检索增强的开放词汇全景分割

计算机视觉与模式识别 2026-01-21 v1 计算与语言

摘要

给定输入图像和一组类别名称,全景分割旨在为图像中的每个像素标注类别标签和实例标签。相比之下,开放词汇全景分割旨在根据用户输入实现对任意类别的分割。挑战在于,在特定数据集上训练的全景分割系统通常无法很好地泛化到训练数据之外的未见类别。在这项工作中,我们提出了RetCLIP,一种检索增强的全景分割方法,可提高未见类别的性能。具体来说,我们使用配对的图像-文本数据构建了一个掩码片段特征数据库。在推理时,我们使用输入图像中的掩码片段特征作为查询键,从数据库中检索相似的特征和相关的类别标签。基于查询特征与检索特征之间的相似度,为掩码片段分配分类分数。将基于检索的分类分数与基于CLIP的分数相结合,产生最终输出。我们将我们的解决方案与之前的最先进方法(FC-CLIP)相结合。在COCO上训练后,所提出的方法在ADE20k数据集上展示了30.9 PQ、19.3 mAP、44.0 mIoU,相比基线实现了+4.5 PQ、+2.5 mAP、+10.0 mIoU的绝对提升。

关键词

引用

@article{arxiv.2601.12779,
  title  = {Open Vocabulary Panoptic Segmentation With Retrieval Augmentation},
  author = {Nafis Sadeq and Qingfeng Liu and Mostafa El-Khamy},
  journal= {arXiv preprint arXiv:2601.12779},
  year   = {2026}
}