中文

桥接视觉显著性与大型语言模型以实现医学影像中可解释的深度学习

计算机视觉与模式识别 2026-05-08 v1 机器学习

摘要

深度学习模型的不透明性仍然是其在医学影像领域临床应用的重要障碍。本文提出了一种多模态可解释性框架,利用大型语言模型(LLMs)提供人类可解读的诊断叙述,从而弥合卷积神经网络(CNN)预测与临床可操作见解之间的差距,用于脑肿瘤分类。所提框架通过三个耦合阶段运行。首先,对九种 CNN 架构进行扩展,采用双输出混合公式同时优化分类头和分割头,以实现空间上更丰富的特征学习。其次,应用视觉显著性归因方法(即 Grad-CAM、Grad-CAM++ 和 ScoreCAM)生成类判别性热图,随后通过自适应百分位阈值处理流程将其细化为二值肿瘤掩码。第三,将生成的掩码映射到 Harvard-Oxford 皮层图谱上,将像素级证据转化为命名的神经解剖结构,并将提取的发现编码为结构化 JSON 文件,以此作为三个 LLMs(Grok3、Mistral 和 LLaMA)的条件来生成连贯的、放射学风格的诊断报告。在包含三类肿瘤的 4,834 张对比增强 T1 加权脑 MRI 图像数据集上进行评估,InceptionResNetV2 取得了最高的分类性能,而 Grad-CAM++ 产生了最佳的分割重叠度。在语言模型中,Grok3 在词汇多样性和连贯性方面领先,而 LLaMA 取得了最高的可读性得分。通过将视觉、解剖和语言模态整合到统一流程中,该框架生成的解释在技术上有依据且具有意义的可解释性,推进了人工智能辅助脑肿瘤诊断的透明度和临床问责制。

关键词

引用

@article{arxiv.2605.06197,
  title  = {Bridging visual saliency and large language models for explainable deep learning in medical imaging},
  author = {Paul Valery Nguezet and Elie Tagne Fute and Yusuf Brima and Benoit Martin Azanguezet and Marcellin Atemkeng},
  journal= {arXiv preprint arXiv:2605.06197},
  year   = {2026}
}