基于基础模型的无训练外分布语义分割
计算机视觉与模式识别
2025-10-06 v1
摘要
检测语义分割中的未知对象对于安全关键应用(如自动驾驶)至关重要。大型视觉基础模型(包括 DINOv2、InternImage 和 CLIP)通过提供跨 diverse 任务高度可泛化的丰富特征,推动了视觉表征学习。尽管这些模型在封闭集语义任务中表现突出,但其在语义分割中检测外分布(OoD)区域的能力仍未得到充分探索。本文我们研究在无任何异常监督情况下,基于在语义分割数据集上微调的基础模型是否能本质上区分内分布(ID)和 OoD 区域。我们提出一种简单且无训练的方法,利用 InternImage 主干网络的特征,并对原始解码器 logits 应用 K 均值聚类和置信度阈值,以识别 OoD 聚类。该方法在 RoadAnomaly 数据集上实现 50.02 的平均精度,在 ADE-OoD 数据集上达到 48.77,超越了多个监督和无监督基线。这些结果表明,无需额外假设或数据的通用 OoD 分割方法正走在有希望的道路上。
引用
@article{arxiv.2510.02909,
title = {Training-Free Out-Of-Distribution Segmentation With Foundation Models},
author = {Laith Nayal and Hadi Salloum and Ahmad Taha and Yaroslav Kholodov and Alexander Gasnikov},
journal= {arXiv preprint arXiv:2510.02909},
year = {2025}
}
备注
12 pages, 5 figures, 2 tables, ICOMP 2025