基于Wasserstein距离对齐的VLM医学影像分布式OOD检测零样本局部化
计算机视觉与模式识别
2026-05-07 v1
摘要
基于视觉语言模型(VLMs)的零样本异常局部化为罕见病理检测提供了有力的方法,但其性能受限于缺乏健康解剖背景。我们将零样本局部化重新表述为通过结构化比较来识别异常的比较推理问题,异常通过与正常解剖的参考分布进行结构化比较来识别。我们提出了WALDO(Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection),该框架基于最优传输理论,实现比较推理:(i) 基于DINOv2补丁分布的熵加权Sliced Wasserstein距离进行解剖感知的参考选择;(ii) 利用参考相似性与局部化准确性之间非单调关系的黄金ilocks区采样;(iii) 通过加权非最大抑制实现自一致性聚合。我们通过分布性差异理论分析了黄金效应,展示了具有中等相似性的参考在比较视觉推理中最小化偏差-方差权衡。在NOVA大脑MRI基准测试上,WALDO使用Qwen2.5-VL-72B实现了43.5±1.6% mAP@30(95%置信区间:[40.4, 46.7]),相对于零样本基线实现了19%的相对改进。跨模型评估显示一致的收益:GPT-4o实现32.0±6.5%,Qwen3-VL-32B实现32.0±6.6% mAP@30。配对McNemar检验确认统计显著性(p<0.01)。源代码可在 https://github.com/bkainz/WALDO_MICCAI26_demo 获取。
引用
@article{arxiv.2605.05161,
title = {Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection in Medical Imaging},
author = {Bernhard Kainz and Johanna P Mueller and Matthew Baugh and Cosmin Bercea},
journal= {arXiv preprint arXiv:2605.05161},
year = {2026}
}
备注
submitted to MICCAI 2026