中文

WOW-Seg:一个无需词语的开放世界分割模型

计算机视觉与模式识别 2026-05-19 v1

摘要

开放世界图像分割旨在解决面对现实世界中无限开放的对象类别集合时,实现对图像中目标的精确分割和语义理解的挑战。然而,传统的封闭集分割方法难以适应复杂的开放世界情景,而像SAM这样的基础分割模型则在其强大的分割能力与相对较弱的语义理解之间存在显著差距。为弥合这一差距,我们提出WOW-Seg,一个用于从开放集类别中对目标进行分割和识别的无词语开放世界分割模型。具体而言,WOW-Seg引入了一种新颖的视觉提示模块,Mask2Token,将图像掩码转换为视觉标记,并确保其与VLLM特征空间的对齐。此外,我们引入级联注意力掩码(Cascade Attention Mask)以解耦不同实例之间的信息。该方法缓解了实例间的干扰,显著提高了模型性能。我们进一步构建了一个开放世界区域识别测试基准:区域识别数据集(RR-7K)。该数据集包含7,662个类别,目前规模最大、类别最丰富的区域识别数据集。WOW-Seg在LVIS数据集上取得了强劲的成绩,实现了89.7的语义相似度和82.4的语义IoU。该成绩在参数数量仅为前述方法的1/8的情况下,超过了之前的最新成果。这一结果凸显了WOW-Seg在开放世界泛化方面的强大能力。相关代码和资源可在https://github.com/AAwcAA/WOW-Seg-Meta获取。

关键词

引用

@article{arxiv.2605.16903,
  title  = {WOW-Seg: A Word-free Open World Segmentation Model},
  author = {Danyang Li and Tianhao Wu and Bin Li and Zhenyuan Chen and Yang Zhang and Yuxuan Li and Ming-Ming Cheng and Xiang Li},
  journal= {arXiv preprint arXiv:2605.16903},
  year   = {2026}
}

备注

Accepted by ICLR 2026. Code and benchmark dataset are available at https://github.com/AAwCAA/WOW-Seg-Meta