中文

利用多模态数据提升放射学中疾病分类的泛化性与可解释性

计算机视觉与模式识别 2022-08-01 v1 机器学习 定量方法

摘要

传统的放射学诊断数据集往往仅提供放射影像及放射报告。然而,由放射科医生执行的读片是一个复杂过程,诸如读片过程中放射科医生眼动注视点等信息有可能成为极具价值的学习数据源。尽管如此,此类数据的收集昂贵且耗时。这引出了一个问题:此类数据是否值得投入收集。本文利用近期发布的 Eye-Gaze 数据集,针对在 varying 水平的输入特征(即:放射影像、放射报告文本以及放射医生眼动注视数据)下,深度学习(DL)分类的性能与可解释性影响进行了详尽研究。我们发现,X 射线图像的最佳分类性能由放射报告自由文本与放射影像组合取得,而眼动注视数据未带来性能提升。尽管如此,眼动注视数据作为与类别标签并列的辅助真值,可得到高度可解释的模型,其生成的注意力图优于未使用眼动注视数据训练的分类与注意力图生成模型。

关键词

引用

@article{arxiv.2207.14781,
  title  = {Using Multi-modal Data for Improving Generalizability and Explainability of Disease Classification in Radiology},
  author = {Pranav Agnihotri and Sara Ketabi and Khashayar and Namdar and Farzad Khalvati},
  journal= {arXiv preprint arXiv:2207.14781},
  year   = {2022}
}