中文

Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models: RADSeg

计算机视觉与模式识别 2026-04-13 v2

摘要

开放词汇语义分割 (OVSS) 支撑着许多需要通用语义理解的视觉和机器人任务。现有方法要么依赖有限的分割训练数据,这会限制泛化性,要么对视觉语言模型 (如 CLIP) 应用零射 heuristics,而最具竞争力的方法则组合多个模型以提高性能,但代价是高计算和内存需求。在本工作中,我们利用被忽视的聚类视觉基础模型 RADIO 来在三个关键轴上同步提高零射OVSS的mIoU、延迟和参数效率。我们对RADIO用于零射OVSS进行首次全面研究,并通过自相关递归注意力、自相关全局聚合和计算高效的RADIO SAM掩码细化来提升其性能。我们的做法 RADSeg 在基本ViT类别上实现了6-30%的mIoU改进,同时快3.95倍,使用的参数减少2.5倍。令人惊讶的是,RADSeg-base (106M) 在mIoU上超过了之前组合巨型视觉模型 (850-1350M) 的组合结果,在计算和内存成本大幅降低的情况下实现了最先进的准确性。

关键词

引用

@article{arxiv.2511.19704,
  title  = {RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models},
  author = {Omar Alama and Darshil Jariwala and Avigyan Bhattacharya and Seungchan Kim and Wenshan Wang and Sebastian Scherer},
  journal= {arXiv preprint arXiv:2511.19704},
  year   = {2026}
}

备注

Accepted to CVPR'26 Findings Code at https://radseg-ovss.github.io/