被 caption 背叛:面向开放词汇实例分割的联合 caption 定位与生成
计算机视觉与模式识别
2023-07-25 v2
摘要
在本文中,我们关注开放词汇实例分割,以将分割模型扩展至对实例级新类别进行分类与分割。先前的方法依赖大规模caption数据集与复杂流水线来建立图像区域与caption中词汇的一一映射。然而,此类方法通过将不可见词(如形容词和动词)匹配到图像区域而构建了含噪监督。同时,上下文词对于推断新物体的存在也十分重要,因为它们与新类别表现出高度互相关性。为克服这些局限,我们设计了一个联合\textbf{Caption定位与生成(CGG)}框架,其引入了一种新颖的定位损失,仅聚焦于匹配物体名词以提升学习效率。我们还引入了一个caption生成头,作为定位损失的补充,提供额外监督与上下文建模。我们的分析与结果表明,定位与生成组件相互补充,显著增强了新类别的分割性能。在COCO数据集上以两种设定:开放词汇实例分割(OVIS)与开放集全景分割(OSPS)进行的实验证明了CGG的优越性。具体而言,在无需额外数据的情况下,CGG在OVIS任务上对新类别的mAP实现了6.8%的大幅提升,并在OSPS基准上对新类别的PQ提升了15%。
引用
@article{arxiv.2301.00805,
title = {Betrayed by Captions: Joint Caption Grounding and Generation for Open Vocabulary Instance Segmentation},
author = {Jianzong Wu and Xiangtai Li and Henghui Ding and Xia Li and Guangliang Cheng and Yunhai Tong and Chen Change Loy},
journal= {arXiv preprint arXiv:2301.00805},
year = {2023}
}
备注
ICCV-2023