基于谱图抽炼的物体-上下文感知开放词汇语义分割
计算机视觉与模式识别
2025-04-08 v3
摘要
开放词汇语义分割(OVSS)通过最近的视觉-语言模型(VLMs)取得了进展,使其能够通过各种学习方案实现超出预定义类别的分割。值得注意的是,训练无关的方法为处理未见数据提供了可扩展且易于部署的解决方案,这是 OVSS 的关键目标。然而,一个关键问题仍然存在:在基于任意查询提示的 OVSS 挑战环境中,对复杂物体缺乏物体级别上下文的考虑。这一疏忽限制了模型在将语义一致的元素正确分组并映射到用户定义的任意类别方面的能力。本文引入了一种新方法,通过在图像中包含物体级别的上下文知识来克服这一限制。具体而言,我们的模型通过从视觉基础模型提取谱图驱动特征来增强注意力机制中的物体内一致性,从而使语义连贯的组件形成单个物体掩码。此外,我们通过零时刻物体存在概率来细化文本嵌入,以确保准确地与图像中表示的特定物体对齐。通过利用物体级别的上下文知识,我们的所提出的方法在 diverse 数据集上实现了最先进的性能,具有强大的鲁棒性。
引用
@article{arxiv.2411.17150,
title = {Distilling Spectral Graph for Object-Context Aware Open-Vocabulary Semantic Segmentation},
author = {Chanyoung Kim and Dayun Ju and Woojung Han and Ming-Hsuan Yang and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2411.17150},
year = {2025}
}