中文

基于视觉语言模型的拓扑异常检测:Topo-R1

计算机视觉与模式识别 2026-05-14 v2

摘要

在血管、神经纤维和道路网络等管状结构中,连通性和环路结构至关重要,决定了下游功能分析。视觉语言模型(VLM)因其推理和 grounding 能力而成为理解此类结构的有前景的候选者。为探索其拓扑感知能力,我们系统评估了领先的封闭式和开源VLM在定位和分类四类经典拓扑异常(断裂/伪连接、缺失/多余分支)方面的性能。它们的表现几乎与随机水平相当,这表明当前通用VLM中缺乏拓扑感知。由于不存在将分割掩码与局部异常注释配对的现有资源,我们构建了一个自动化、跨域的数据构建管道,该管道综合了多样化的拓扑扰动,并通过可验证的Betti数注释,跨不同难度级别,产生了第一个大规模训练集和保留的分布内(ID)和分布外(OOD)测试套件。建立在此基准之上,我们引入Topo-R1,该方法以拓扑感知复合奖励为中心,联合评分定位、分类和骨架级结构忠诚度。监督式fine-tuning cold-start启动了符合规范的输出,Group Relative Policy Optimization (GRPO)随后针对该奖励优化策略,将预测引导向拓扑上有意义的结构,而非仅仅是像素重叠。大量实验表明,Topo-R1在ID、OOD和真实分割输出协议下均显著优于通用VLM,并在多数情况下匹配或超越监督式基线,为VLM用于结构化视觉数据的拓扑理解奠定了坚实基础。

关键词

引用

@article{arxiv.2603.13054,
  title  = {Topo-R1: Detecting Topological Anomalies via Vision-Language Models},
  author = {Meilong Xu and Qingqiao Hu and Xiaoling Hu and Shahira Abousamra and Xin Yu and Weimin Lyu and Kehan Qi and Dimitris Samaras and Chao Chen},
  journal= {arXiv preprint arXiv:2603.13054},
  year   = {2026}
}

备注

26 pages, 6 figures