基于视觉语言特征对道路异常进行分割对齐
计算机视觉与模式识别
2026-03-03 v1
摘要
复杂环境中的安全自主系统需要可靠的道路异常分割来识别未知障碍物。然而,现有方法常依赖像素级统计来判断区域是否异常。这种依赖导致在天空或植被等语义正常背景区域上产生高假阳性率,同时对真正的离分布(Out-of-distribution, OOD)实例召回率差,给机器人感知与决策带来安全风险。为此,我们提出 VL-Anomaly(Vision-Language Anomaly),一种视觉语言异常分割框架,融合来自预训练视觉语言模型(VLMs)的语义先验。具体而言,我们设计了一种基于提示学习驱动的对齐模块,将 Mask2Forme 的视觉特征适配到 CLIP 文本嵌入的已知类别中,从而有效抑制背景区域的虚假异常响应。在推理阶段,我们进一步引入多源推理策略,整合文本引导的相似性、CLIP 图像-文本相似性和检测器置信度,实现更可靠的异常预测,利用互补信息源。广泛的实验表明,VL-Anomaly 在包含 RoadAnomaly、SMIYC 和 Fishyscapes 的基准数据集上实现了最先进的性能。我们的代码已发布于 https://github.com/NickHezhuolin/VL-aligner-Road-anomaly-segment。
引用
@article{arxiv.2603.01029,
title = {Vision-Language Feature Alignment for Road Anomaly Segmentation},
author = {Zhuolin He and Jiacheng Tang and Jian Pu and Xiangyang Xue},
journal= {arXiv preprint arXiv:2603.01029},
year = {2026}
}