中文

MagicSeg:基于反事实扩散的开放世界分割预训练

计算机视觉与模式识别 2026-03-24 v1

摘要

开放世界语义分割目前严重依赖大规模的图像-文本配对数据集,而这些数据集常常因缺乏足够类别的细粒度像素标注而受限。获取此类数据的成本高昂,需投入大量人力和时间。鉴于扩散模型在图像生成方面的卓越能力,我们提出一种新型的扩散模型驱动的数据集自动生成流程,命名为“MagicSeg”。我们的MagicSeg从类别标签开始,生成高保真的文本描述,再据此引导扩散模型生成图像。与仅生成每个标签的正样本不同,我们的流程同时生成对应的负面图像,作为对抗训练的配对反事实样本。随后,为开放世界分割预训练提供自监督信号,MagicSeg集成了开放词汇检测模型和交互式分割模型,依据提供的类别标签从图像中提取对象掩码作为精确的分割标签。通过对抗语言-图像预训练模型应用伪掩码监督和辅助反事实对抗训练,下游模型在开放世界语义分割任务上获得卓越性能。我们在PASCAL VOC、PASCAL Context和COCO数据集上进行评估,分别实现了62.9%、26.7%和40.2%的SOTA性能,证明了该数据集在提升开放世界语义分割能力方面的有效性。项目网址:https://github.com/ckxhp/magicseg。

关键词

引用

@article{arxiv.2603.19575,
  title  = {MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation},
  author = {Kaixin Cai and Pengzhen Ren and Jianhua Han and Yi Zhu and Hang Xu and Jianzhuang Liu and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2603.19575},
  year   = {2026}
}