中文

理解基于改进 Transformer 架构的迁移学习用于胸部 X 线临床报告生成

图像与视频处理 2022-05-09 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

图像描述生成任务在医学人工智能应用中日益普遍。一个重要应用是根据胸部 X 线生成临床报告。非结构化报告的临床书写耗时且易出错。自动化系统将改善标准化、减少错误、节省时间并提升医疗可及性。本文中,我们证明了领域特定预训练的重要性,并提出了一种用于医学图像描述任务的改进 Transformer 架构。为此,我们训练了一系列改进 Transformer 从胸部 X 线图像输入生成临床报告。这些改进 Transformer 包括:使用 ImageNet 预训练权重的视觉提取器的网格记忆增强 Transformer 架构、使用 CheXpert 预训练权重的视觉提取器的网格记忆增强 Transformer 架构,以及将使用 ImageNet 预训练权重和 CheXpert 预训练权重的拼接嵌入传入编码器的网格记忆增强 Transformer。我们使用 BLEU(1-4)、ROUGE-L、CIDEr 和临床 CheXbert F1 分数验证模型,并展示了与最先进模型具竞争力的分数。我们提供证据表明 ImageNet 预训练不适合医学图像描述任务,尤其对较少见病症(如心纵隔增大、肺病变、气胸)。此外,我们证明双特征模型提升了特定病症(水肿、实变、气胸、支持设备)的性能及总体 CheXbert F1 分数,应在未来工作中进一步发展。这种包含 ImageNet 预训练及领域特定预训练的双特征模型可用于广泛的医学图像描述模型。

关键词

引用

@article{arxiv.2205.02841,
  title  = {Understanding Transfer Learning for Chest Radiograph Clinical Report Generation with Modified Transformer Architectures},
  author = {Edward Vendrow and Ethan Schonfeld},
  journal= {arXiv preprint arXiv:2205.02841},
  year   = {2022}
}