ROSE:基于 patch-wise 感知的革命性开放集密集分割大型多模态模型
计算机视觉与模式识别
2025-03-12 v3 机器学习
摘要
CLIP 和大型多模态模型 (LMM) 的进展使得开放词汇和自由文本分割成为可能,但现有模型仍需要预定义类别提示,限制了自由形式的类别自生成。大多数分割 LMM 仍局限于稀疏预测,限制了其在开放集环境中的应用。相比之下,我们提出了 ROSE,即 Revolutionary Open-set dense SEgmentation LMM,能够通过 patch-wise 感知实现密集掩码预测和开放类别生成。我们的方法将每个图像 patch 视为独立的兴趣区域候选人,使模型能够同时预测密集掩码和稀疏掩码。此外,设计了新颖的指令-响应范式,充分发挥 LMM 的生成和泛化能力,实现类别预测独立于封闭集限制或预定义类别。为了进一步增强掩码细节和类别精度,我们引入了基于对话的细化范式,将来一步的预测结果与文本提示集成进行修订。广泛的实验表明,ROSE 在统一框架中实现了各种分割任务的竞争性能。代码将在发布。
引用
@article{arxiv.2412.00153,
title = {ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model},
author = {Kunyang Han and Yibo Hu and Mengxue Qu and Hailin Shi and Yao Zhao and Yunchao Wei},
journal= {arXiv preprint arXiv:2412.00153},
year = {2025}
}