EOV-Seg:高效的开放词汇全景分割
计算机视觉与模式识别
2024-12-17 v2
摘要
开放词汇全景分割旨在对各种场景中所有内容进行分割和分类,涵盖不受限制的词汇表。现有方法通常采用两种框架:两种框架要么涉及使用掩码生成器对图像进行多次裁剪,然后进行特征提取,要么依赖重型掩码解码器通过自注意力和交叉注意力在多个堆叠的 Transformer 块中弥补空间位置信息的不足。两种方法都导致巨大的计算开销,从而阻碍了模型推理的效率。为填补效率之间的空白,我们提出了 EOV-Seg,这是一个新颖的单阶段、共享、高效且具有空间感知能力的框架,专为开放词汇全景分割设计。具体而言,EOV-Seg 在两个方面进行了创新。首先,提出了一种词汇感知选择 (Vocabulary-Aware Selection, VAS) 模块,用于改进视觉聚合特征的语义理解,并减轻掩码解码器上的特征交互负担。其次,我们引入了一种双向动态嵌入专家 (Two-way Dynamic Embedding Experts, TDEE),有效利用基于 ViT 的 CLIP 主干网络的空间感知能力。到目前为止,EOV-Seg 是首个面向效率的开放词汇全景分割框架,该框架比最先进的方法运行更快且实现了竞争性能。具体而言,仅使用 COCO 训练,EOV-Seg 在 ADE20K 数据集上 achieves 24.5 PQ、32.1 mIoU 和 11.6 FPS,EOV-Seg 的推理时间比最先进的方法快 4-19 倍。特别地,配备 ResNet50 主干网络时,EOV-Seg 在单个 RTX 3090 GPU 上以 23.8 FPS 运行,仅使用 71M 参数。代码可在 https://github.com/nhw649/EOV-Seg 上获取。
引用
@article{arxiv.2412.08628,
title = {EOV-Seg: Efficient Open-Vocabulary Panoptic Segmentation},
author = {Hongwei Niu and Jie Hu and Jianghang Lin and Guannan Jiang and Shengchuan Zhang},
journal= {arXiv preprint arXiv:2412.08628},
year = {2024}
}
备注
Accepted by AAAI 2025