Gaze: 基于观察者工具和文献检索的 grounding 智能体零样评估——用于罕见脑部 MRI
机器学习
2026-05-05 v1 计算机视觉与模式识别
摘要
视觉语言模型(VLM)通过单次前向传播读取图像并生成文本,而放射科医生则通常多次检查图像并咨询文献后才撰写报告。我们引入 GAZE(Grounded Agentic Zero-shot Evaluation),一个框架,使医学 VLM 能够以迭代方式工作,通过调用观察者级工具(缩放、窗口、对比度、边缘检测)以及两个由美国国家图书馆(PubMed 医学文献、Open-i 放射学图像)支持的检索工具,输出结构化结果并通过模式验证,其完整工具调用轨迹记录以便审计。在覆盖 281 种罕见神经病理条件的 906 例脑部 MRI 案例的 NOVA 基准测试上,GAZE 在 IoU=0.3 时实现 58.2% 平均精度(mAP),在联合协议下实现 34.9% 的 Top-1 诊断准确率。该协议仅凭图像即可对报告、诊断和定位进行评分,无需任务特定微调。即使在工具调用之前,结构化提示和模式验证后的输出也已超过已发布的 Gemini 2.0 Flash 基线(20.2 增至 29.4 [email protected]),因此框架设计本身即是一个实验变量。工具使用对罕见病变帮助显著:IoU>0.3 的案例比例从 17% 提升至 58%(针对样本数≤3 的诊断),而对常见疾病(≥10 例)则从 25% 提升至 68%,收益与使用程度正相关(Gemini 3 Flash: Cohen's d=0.79,平均 11.8 次调用/案例;Gemini 2.0 Flash:仅 8.2% 的案例使用工具,无显著效益)。检索消融实验还揭示,诊断提升可能伴随定位下降,这强化了在医学 VLM 中对诊断、定位和报告进行联合评估的必要性。
引用
@article{arxiv.2605.00876,
title = {GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI},
author = {Duaa Alim and Mogtaba Alim and Liam Chalcroft},
journal= {arXiv preprint arXiv:2605.00876},
year = {2026}
}