中文

一种基于 Transformer 并统一处理多模态输入的临床诊断表示学习模型

计算机视觉与模式识别 2023-06-02 v1 计算与语言 机器学习

摘要

在诊断过程中,临床医生会利用多模态信息,如主诉、医学图像和实验室检查结果。用于辅助诊断的深度学习模型尚未满足这一要求。在此我们报告了一种基于 Transformer 的表示学习模型作为临床诊断辅助,该模型以统一方式处理多模态输入。该模型不学习特定模态的特征,而是使用嵌入层将图像以及非结构化和结构化文本转换为视觉 token 和文本 token,并使用具有模态内和模态间注意力的双向块来学习 X 光片、非结构化主诉和临床病史、结构化临床信息(如实验室检查结果和患者人口统计信息)的整体表示。在肺部疾病识别(分别提升 12% 和 9%)以及 COVID-19 患者不良临床结局预测(分别提升 29% 和 7%)中,该统一模型优于仅图像模型和非统一多模态诊断模型。利用统一的多模态基于 Transformer 的模型可能有助于简化患者分诊并促进临床决策过程。

关键词

引用

@article{arxiv.2306.00864,
  title  = {A Transformer-based representation-learning model with unified processing of multimodal input for clinical diagnostics},
  author = {Hong-Yu Zhou and Yizhou Yu and Chengdi Wang and Shu Zhang and Yuanxu Gao and Jia Pan and Jun Shao and Guangming Lu and Kang Zhang and Weimin Li},
  journal= {arXiv preprint arXiv:2306.00864},
  year   = {2023}
}

备注

Accepted by Nature Biomedical Engineering