OpenSD:统一的开放词汇分割与检测
计算机视觉与模式识别
2023-12-13 v1
摘要
近期,一些开放词汇方法被提出,它们采用统一架构来处理通用的分割和检测任务。然而,由于不同任务之间的冲突,其性能仍落后于特定任务模型,并且由于对CLIP的利用不足,其开放词汇能力也受到限制。为了解决这些挑战,我们提出了一个基于Transformer的通用框架,简称为OpenSD,它利用相同的架构和网络参数来处理开放词汇的分割和检测任务。首先,我们引入了一种解码器解耦学习策略,以缓解物体类别和背景类别之间的语义冲突,从而使每个单独的任务能在同一框架下更有效地学习。其次,为了更好地利用CLIP进行端到端的分割和检测,我们提出了双分类器,分别处理词汇内域和词汇外域。通过解耦提示学习,文本编码器被进一步训练为对物体和背景类别都具有区域感知能力,使其能够过滤掉重复和低质量的预测,这对于端到端的分割和检测至关重要。我们在多种情况下的多个数据集上进行了广泛的实验。结果表明,OpenSD在封闭词汇和开放词汇设置下,均优于最先进的开放词汇分割和检测方法。代码可在 https://github.com/strongwolf/OpenSD 获取。
引用
@article{arxiv.2312.06703,
title = {OpenSD: Unified Open-Vocabulary Segmentation and Detection},
author = {Shuai Li and Minghan Li and Pengfei Wang and Lei Zhang},
journal= {arXiv preprint arXiv:2312.06703},
year = {2023}
}