TandemNet:以诊断报告作为可选语义参考从医学图像中提取知识
计算机视觉与模式识别
2017-08-11 v1
摘要
本文通过我们提出的新型多模态神经网络 TandemNet,引入医学图像诊断报告中的语义知识,以提供具有启发性的网络训练和可解释的预测机制。在 TandemNet 内部,使用语言模型来表示报告文本,该模型以串联方案与图像模型协同工作。我们提出了一种新颖的双注意力模型,促进了视觉与语义信息之间的高级交互,并有效提取用于预测的有用特征。在测试阶段,TandemNet 可以在可选的报告文本输入下进行准确的图像预测。它还通过在图像和文本信息特征片段上产生注意力来解释其预测,并进一步生成诊断报告段落。基于病理膀胱癌图像及其诊断报告(BCIDR)数据集,充分的实验表明我们的方法有效地学习并整合了来自多模态的知识,并且与对比基线相比获得了显著提升的性能。
引用
@article{arxiv.1708.03070,
title = {TandemNet: Distilling Knowledge from Medical Images Using Diagnostic Reports as Optional Semantic References},
author = {Zizhao Zhang and Pingjun Chen and Manish Sapkota and Lin Yang},
journal= {arXiv preprint arXiv:1708.03070},
year = {2017}
}
备注
MICCAI2017 Oral