中文

基于多模态提示的统一开放世界分割

计算机视觉与模式识别 2025-10-14 v1

摘要

本文提出了 COSINE,一个统一的开放世界分割模型,整合了多模态提示(如文本和图像)下的开放词汇分割和上下文分割。COSINE 利用基础模型提取输入图像及其对应多模态提示的表征,并通过 SegDecoder 对这些表征进行对齐、建模其相互作用,从而获得由输入提示在不同粒度范围内指定的掩码。如此一来,COSINE 克服了以往方法在开放词汇分割和上下文分割管道中存在的架构差异、目标函数不一致以及表征学习策略的不同问题。 comprehensive 实验表明,COSINE 在开放词汇分割和上下文分割任务中均实现了显著的性能提升。我们的探索性分析表明,利用视觉和文本提示之间的协同作用,能够显著优于单模态方法的泛化能力。

关键词

引用

@article{arxiv.2510.10524,
  title  = {Unified Open-World Segmentation with Multi-Modal Prompts},
  author = {Yang Liu and Yufei Yin and Chenchen Jing and Muzhi Zhu and Hao Chen and Yuling Xi and Bo Feng and Hao Wang and Shiyu Li and Chunhua Shen},
  journal= {arXiv preprint arXiv:2510.10524},
  year   = {2025}
}

备注

Accepted to ICCV2025