SegGPT:在上下文中分割一切
计算机视觉与模式识别
2023-04-07 v1
摘要
我们提出了 SegGPT,一个在上下文中分割一切的通用模型。我们将各种分割任务统一到一个通用上下文学习框架中,通过将不同类型的分割数据转换为相同的图像格式来容纳它们。SegGPT 的训练被表述为一个上下文着色问题,对每个数据样本进行随机颜色映射。其目标是根据上下文完成各种任务,而不是依赖特定颜色。训练后,SegGPT 可以通过上下文推理在图像或视频中执行任意分割任务,例如物体实例、物体类别、部分、轮廓和文本。SegGPT 在广泛的任务上进行了评估,包括少样本语义分割、视频物体分割、语义分割和全景分割。我们的结果在定性和定量上均显示出在分割领域内和领域外目标方面的强大能力。
引用
@article{arxiv.2304.03284,
title = {SegGPT: Segmenting Everything In Context},
author = {Xinlong Wang and Xiaosong Zhang and Yue Cao and Wen Wang and Chunhua Shen and Tiejun Huang},
journal= {arXiv preprint arXiv:2304.03284},
year = {2023}
}
备注
Code and Demo: https://github.com/baaivision/Painter