Semantic-SAM:以任意粒度分割并识别任何事物
计算机视觉与模式识别
2023-07-11 v1
摘要
本文介绍 Semantic-SAM,一种通用图像分割模型,旨在以任意所需粒度分割并识别任何事物。我们的模型具有两个关键优势:语义感知与粒度丰富。为实现语义感知,我们整合了三个粒度上的多个数据集,并引入对象与部件的解耦分类。这使我们的模型能够捕获丰富的语义信息。对于多粒度能力,我们在训练中提出多选择学习方案,使每次点击生成对应于多个真值掩码的多层级掩码。值得注意的是,本工作是首次尝试在 SA-1B、通用分割与部件分割数据集上联合训练一个模型。实验结果和可视化表明,我们的模型成功实现了语义感知与粒度丰富。此外,将 SA-1B 训练与其他分割任务(如全景分割与部件分割)结合可带来性能提升。我们将提供代码与演示以供进一步探索与评估。
引用
@article{arxiv.2307.04767,
title = {Semantic-SAM: Segment and Recognize Anything at Any Granularity},
author = {Feng Li and Hao Zhang and Peize Sun and Xueyan Zou and Shilong Liu and Jianwei Yang and Chunyuan Li and Lei Zhang and Jianfeng Gao},
journal= {arXiv preprint arXiv:2307.04767},
year = {2023}
}