SegRAG:基于检索增强的无训练语义分割
计算机视觉与模式识别
2026-05-21 v2
摘要
开词表语义分割模型如 SAM3 通过文本提示在广泛类别上表现良好,但在目标类别在预训练中视觉上不足或偏离标准表现时会退化——这些局限性无法通过文本提示来解决。我们提出 SegRAG,一个训练-free 检索增强语义分割框架,通过来自精选 DINOv3 特征库中提取的类别特定点提示来为 SAM3 提供依托。在离线阶段,提取密集的 patch 级别描述符,并通过类内内聚蒸馏 (ICCD) 进行筛选,保留那些可靠检索类内前景的原型。在推理阶段,TSG (拓扑相似性 grounding) 计算余弦相似度景观,识别通过连通分量分析识别一致的高置信区域,并通过非极大值抑制提取峰值位置。得到的点提示与类别名称文本一起传递给 SAM3 进行单次前向传播。在四个标准基准上,SegRAG consistently 优于仅文本基线,LVIS 上提升最高可达 +3.92 mIoU。在 AgML 农业基准的零样本域迁移任务中,将平均 IoU 从 25.27 提升至 59.24(提升 +33.97),并将个别类别从 0 恢复到 95 以上 mIoU。消融实验确认,ICCD、TSG 和联合提示各自独立贡献,且组合后效果叠加。代码已公开于 (https://github.com/boudiafA/SegRAG)。
引用
@article{arxiv.2605.17630,
title = {SegRAG: Training-Free Retrieval-Augmented Semantic Segmentation},
author = {Abderrahmene Boudiaf and Irfan Hussain and Sajid Javed},
journal= {arXiv preprint arXiv:2605.17630},
year = {2026}
}