中文

EMAD:以证据为中心的多模态阿尔茨海默病诊断

计算机视觉与模式识别 2026-02-24 v1

摘要

用于医学图像分析的深度学习模型通常充当黑盒,很少与临床指南保持一致,或明确地将决策与支持证据联系起来。这在阿尔茨海默病(AD)中尤为关键,因为预测应基于解剖学和临床发现。我们提出了EMAD,一个视觉-语言框架,可生成结构化的AD诊断报告,其中每个声明都明确基于多模态证据。EMAD使用分层句子-证据-解剖(SEA)接地机制:(i)句子到证据的接地将生成的句子与临床证据短语联系起来,(ii)证据到解剖的接地在3D脑MRI上定位相应的结构。为了减少密集的标注需求,我们提出了GTX-Distill,它将从有限监督训练的教师模型的接地行为转移到在模型生成报告上操作的学生模型。我们进一步引入了可执行规则GRPO,一种具有可验证奖励的强化学习微调方案,以强制执行临床一致性、协议遵循和推理-诊断连贯性。在AD-MultiSense数据集上,EMAD实现了最先进的诊断准确性,并生成了比现有方法更透明、解剖学上更忠实的报告。我们将发布代码和接地标注,以支持可信医学视觉-语言模型的未来研究。

关键词

引用

@article{arxiv.2602.19178,
  title  = {EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease},
  author = {Qiuhui Chen and Xuancheng Yao and Zhenglei Zhou and Xinyue Hu and Yi Hong},
  journal= {arXiv preprint arXiv:2602.19178},
  year   = {2026}
}

备注

Accepted by CVPR2026