USE:用于开放词汇图像分割的通用段嵌入
计算机视觉与模式识别
2024-06-11 v1
摘要
开放词汇图像分割任务涉及将图像划分为语义上有意义的段,并使用灵活的文本定义的类别对其进行分类。最近的基于视觉的基础模型,如 Segment Anything Model(SAM),在生成无类别图像段方面表现出优越性能。当前开放词汇图像分割的主要挑战在于准确地将这些段分类到文本定义的类别中。本文提出了 Universal Segment Embedding(USE)框架,以解决这一挑战。该框架由两个关键组件构成:1)一个高效整理 various granularities 上 segment-text 对的数据管道;2)一个通用段嵌入模型,使其能够精确地将段分类到广泛的文本定义类别中。USE 模型不仅有助于开放词汇图像分割,还可促进其他下游任务(例如查询和排序)。通过对语义分割和部件分割基准的全面实验研究,我们展示了 USE 框架在开放词汇分割方法方面超过当前最先进的方法。
引用
@article{arxiv.2406.05271,
title = {USE: Universal Segment Embeddings for Open-Vocabulary Image Segmentation},
author = {Xiaoqi Wang and Wenbin He and Xiwei Xuan and Clint Sebastian and Jorge Piazentin Ono and Xin Li and Sima Behpour and Thang Doan and Liang Gou and Han Wei Shen and Liu Ren},
journal= {arXiv preprint arXiv:2406.05271},
year = {2024}
}