从开放词汇到免词汇语义分割
计算机视觉与模式识别
2025-02-18 v1
摘要
开放词汇语义分割使模型能够识别训练数据之外的新颖对象类别。虽然这种灵活性代表了显著的进步,但当前方法仍然依赖手动指定的类别名称作为输入,这在现实应用中造成了固有的瓶颈。本工作提出了一种免词汇语义分割流程,消除了对预定义类别词汇表的需求。具体而言,我们解决了这个“鸡生蛋”问题:用户需要了解场景中所有潜在对象的知识才能识别它们,而分割的目的往往是发现这些对象。所提出的方法利用视觉-语言模型自动识别对象并生成合适的类别名称,旨在解决类别规范和命名质量的挑战。通过在多个公共数据集上的大量实验,我们强调了文本编码器在模型性能中的关键作用,特别是当图像文本类别与生成的描述配对时。尽管分割文本编码器对类别标记过程中的假阴性敏感所带来的挑战增加了任务的复杂性,我们证明了我们全自动化的流程在多样化的现实场景中显著提高了免词汇分割的准确性。
引用
@article{arxiv.2502.11891,
title = {From Open-Vocabulary to Vocabulary-Free Semantic Segmentation},
author = {Klara Reichard and Giulia Rizzoli and Stefano Gasperini and Lukas Hoyer and Pietro Zanuttigh and Nassir Navab and Federico Tombari},
journal= {arXiv preprint arXiv:2502.11891},
year = {2025}
}
备注
Submitted to: Pattern Recognition Letters, Klara Reichard and Giulia Rizzoli equally contributed to this work