开放词汇分割还能为何物?
计算机视觉与模式识别
2025-08-07 v1
摘要
标准的分割方案无法提供能够识别训练词典之外概念的模型。开放词汇方法通过在数十亿图像-文本对上进行语言-图像预训练来弥合这一差距。不幸的是,我们注意到由于存在若干瓶颈,性能已停滞将近两年。本文提出若干新型 oracle 组件,通过充分利用 groundtruth 信息来识别并解耦这些瓶颈。所呈的验证实验提供了重要的经验发现,深入洞察开放词汇模型的失败原因,并为解锁未来研究的前景方法提供了指引。
引用
@article{arxiv.2508.04211,
title = {What Holds Back Open-Vocabulary Segmentation?},
author = {Josip Šarić and Ivan Martinović and Matej Kristan and Siniša Šegvić},
journal= {arXiv preprint arXiv:2508.04211},
year = {2025}
}
备注
Accepted for publication at ICCV 25 Workshop: What is Next in Multimodal Foundation Models?