OMG-Seg:一个模型足以应对所有分割任务吗?
计算机视觉与模式识别
2024-10-02 v2
摘要
在本工作中,我们处理各种分割任务,这些任务传统上由独立或部分统一的模型来解决。我们提出了OMG-Seg,一个足以高效且有效地处理所有分割任务的模型,包括图像语义、实例和全景分割,以及它们的视频对应物、开放词汇设定、提示驱动的交互式分割(如SAM)和视频目标分割。据我们所知,这是第一个在一个模型中处理所有这些任务并取得令人满意性能的模型。我们表明,OMG-Seg是一种基于Transformer的编码器-解码器架构,具有特定任务的查询和输出,可以支持超过十种不同的分割任务,同时显著降低跨各种任务和数据集的计算和参数开销。我们严格评估了协同训练期间任务间的影响和相关性。代码和模型可在 https://github.com/lxtGH/OMG-Seg 获取。
关键词
引用
@article{arxiv.2401.10229,
title = {OMG-Seg: Is One Model Good Enough For All Segmentation?},
author = {Xiangtai Li and Haobo Yuan and Wei Li and Henghui Ding and Size Wu and Wenwei Zhang and Yining Li and Kai Chen and Chen Change Loy},
journal= {arXiv preprint arXiv:2401.10229},
year = {2024}
}
备注
CVPR-2024. Project Page: https://lxtgh.github.io/project/omg_seg/