NOVA:面向脑 MRI 异常局部化与临床推理的基准测试
图像与视频处理
2025-05-21 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
在许多实际应用中,部署的模型会遇到与训练期间看到的输入不同的情形。离散分布检测识别输入是否来自未见过的分布,而开放世界识别则标记此类输入,以确保系统在不断出现的、此前 类别出现且无需重新训练的情况下仍保持鲁棒性。基础模型和视觉语言模型是在大规模且多样化的数据集上预训练的,旨在实现跨领域的广泛泛化,包括医学影像。然而,对仅包含少数常见离群类型测试集进行基准测试,这些模型的表现在实际应用中会隐式地将评估折叠回封闭集问题,掩盖了在临床使用中遇到的稀有或真正新颖条件的失败。因此,我们提出 ,这是一个包含约900个脑 MRI 扫描的具有挑战性的、仅用于评估的基准测试,涵盖281种稀有病理和异构获取协议。每例病例均包含丰富的临床叙述和双盲专家边界框注释。由于 NOVA 从未用于训练,它作为一种 stress-test(极端压力测试),模型必须在样本外观和语义空间之间建立分布差距。基线结果显示,领先的视觉语言模型(GPT-4o、Gemini 2.0 Flash 和 Qwen2.5-VL-72B)在所有任务中的表现均显著下降,确立了 NOVA 作为推进能检测、局部化并就真正未知异常进行推理的模型测试基准的作用。
引用
@article{arxiv.2505.14064,
title = {NOVA: A Benchmark for Anomaly Localization and Clinical Reasoning in Brain MRI},
author = {Cosmin I. Bercea and Jun Li and Philipp Raffler and Evamaria O. Riedel and Lena Schmitzer and Angela Kurz and Felix Bitzer and Paula Roßmüller and Julian Canisius and Mirjam L. Beyrle and Che Liu and Wenjia Bai and Bernhard Kainz and Julia A. Schnabel and Benedikt Wiestler},
journal= {arXiv preprint arXiv:2505.14064},
year = {2025}
}