FreeSeg:统一、通用且开放词表的图像分割
计算机视觉与模式识别
2023-03-31 v1
摘要
近来,开放词表学习兴起以实现基于任意文本描述的类别分割,这将分割系统推广到更通用的应用场景。然而,现有方法致力于为特定分割任务设计专门的架构或参数。这些定制化设计范式导致各种分割任务之间的碎片化,从而阻碍了分割模型的统一性。因此,本文中我们提出 FreeSeg,一个用于实现统一、通用且开放词表图像分割的通用框架。FreeSeg 通过一次性训练优化全合一网络,并在推理过程中采用相同架构和参数无缝处理多样分割任务。此外,自适应提示学习促使统一模型捕获任务感知和类别敏感概念,提升模型在多任务和变化场景中的鲁棒性。大量实验结果表明,FreeSeg 在三个分割任务上的性能和泛化能力建立了新的 SOTA 结果,大幅优于最佳任务专用架构:在 COCO 上未见类语义分割提升 5.5% mIoU,实例分割提升 17.6% mAP,全景分割提升 20.1% PQ。
引用
@article{arxiv.2303.17225,
title = {FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation},
author = {Jie Qin and Jie Wu and Pengxiang Yan and Ming Li and Ren Yuxi and Xuefeng Xiao and Yitong Wang and Rui Wang and Shilei Wen and Xin Pan and Xingang Wang},
journal= {arXiv preprint arXiv:2303.17225},
year = {2023}
}
备注
Accepted by CVPR 2023; camera-ready version