MDNet:一种语义与视觉可解释的医学图像诊断网络
计算机视觉与模式识别
2017-07-11 v1
摘要
大多数现有计算机辅助诊断方法的一个著名缺陷是无法以语义和视觉上有意义的方式解释模型预测。本文提出MDNet以建立医学图像与诊断报告之间的直接多模态映射,该映射能够读取图像、生成诊断报告、通过症状描述检索图像并可视化注意力,从而为网络诊断过程提供解释。MDNet包括图像模型和语言模型。图像模型旨在增强多尺度特征集成与利用效率。语言模型与我们改进的注意力机制集成,旨在从报告中读取并探索有判别力的图像特征描述,以学习从句子词到图像像素的直接映射。整体网络通过使用我们开发的优化策略进行端到端训练。基于一个病理膀胱癌图像及其诊断报告(BCIDR)数据集,我们进行充分实验证明MDNet优于对比基线。所提出的图像模型在两个CIFAR数据集上也取得了最先进的性能。
引用
@article{arxiv.1707.02485,
title = {MDNet: A Semantically and Visually Interpretable Medical Image Diagnosis Network},
author = {Zizhao Zhang and Yuanpu Xie and Fuyong Xing and Mason McGough and Lin Yang},
journal= {arXiv preprint arXiv:1707.02485},
year = {2017}
}
备注
CVPR2017 Oral