面向个性化 OVSS:理解开放词汇语义分割中的个人概念
计算机视觉与模式识别
2025-07-16 v1
摘要
虽然开放词汇语义分割 (OVSS) 能够基于任意给定的文本描述将图像分割为语义区域,即使对于训练期间未出现的类别也能实现,但它无法理解个人文本 (如 "my mug cup") 以分割用户特定感兴趣的区域。本文旨在解决识别 "my mug cup" 在 "multiple mug cups" 中的挑战。为此,我们引入了一种新颖任务,称为 "个人化开放词汇语义分割",并提出了一种基于文本提示调谐的插件方法,用于利用少量图像-掩码对识别个人视觉概念,同时保持原有 OVSS 的性能。基于将文本提示用于此任务时减少误预测至关重要的观察,我们的方法采用 "负面掩码提议" 捕获除个性化概念之外的视觉概念。我们进一步通过将个人概念的视觉嵌入注入文本提示中来丰富文本提示的表示。该方法在不损害原有 OVSS 性能的前提下提升了个人化 OVSS 的性能。我们在新建立的本任务基准测试上展示了我们方法的优越性,包括 FSS、CUB 和 ADE。
引用
@article{arxiv.2507.11030,
title = {Personalized OVSS: Understanding Personal Concept in Open-Vocabulary Semantic Segmentation},
author = {Sunghyun Park and Jungsoo Lee and Shubhankar Borse and Munawar Hayat and Sungha Choi and Kyuwoong Hwang and Fatih Porikli},
journal= {arXiv preprint arXiv:2507.11030},
year = {2025}
}
备注
Accepted to ICCV 2025; 15 pages