超越图像:一种用于胸部 X 光报告生成的集成多模态方法
计算机视觉与模式识别
2023-11-21 v1 人工智能
计算与语言
机器学习
摘要
图像到文本的放射学报告生成旨在自动生成描述医学图像中发现的放射学报告。大多数现有方法仅关注图像数据,忽视了放射科医生可获取的其他患者信息。本文中,我们提出一种新颖的多模态深度神经网络框架,通过整合结构化患者数据(如生命体征和症状)以及非结构化临床笔记来生成胸部 X 光报告。我们引入一个条件交叉多头注意力模块以融合这些异构数据模态,弥合视觉与文本数据间的语义鸿沟。实验表明,与使用图像 alone 相比,利用额外模态带来了显著改进。值得注意的是,我们的模型在 ROUGE-L 指标上取得了文献中相关前沿模型的最高报告性能。此外,我们采用人工评估与临床语义相似度度量以及词重叠指标,以增进定量分析的深度。由认证放射科医生进行的手工评估确认了模型在识别高层发现上的准确性,但也指出在捕捉细微细节与临床语境方面仍需改进。
引用
@article{arxiv.2311.11090,
title = {Beyond Images: An Integrative Multi-modal Approach to Chest X-Ray Report Generation},
author = {Nurbanu Aksoy and Serge Sharoff and Selcuk Baser and Nishant Ravikumar and Alejandro F Frangi},
journal= {arXiv preprint arXiv:2311.11090},
year = {2023}
}