基于放射学报告与胸部 X 光图像的跨模态全局局部表示学习
计算机视觉与模式识别
2023-01-27 v1 计算与语言
摘要
深度学习模型可成功应用于实际问题中;然而,训练此类模型大多需要海量数据。近期方法使用了语言与视觉,但不幸的是,它们依赖于通常未公开的数据集。本文为放射学多模态语言-视觉领域的进一步研究铺平道路。我们训练了一种表示学习方法,借助注意力机制并利用公开可用的印第安纳大学放射学报告(IU-RR)数据集,对语言与视觉的局部和全局表示进行学习。此外,我们利用所学表示诊断五种肺部病变:肺不张、心肥大、水肿、胸腔积液和实变。最后,我们采用有监督与零样本分类,在 IU-RR 数据集上对所学的表示学习性能进行了广泛分析。采用平均曲线下面积(AUC)评估分类器对五种肺部病变分类的准确率。在 IU-RR 测试集上,使用不同训练数据集(即 CheXpert 和 CheXphoto)对五种肺部病变分类的平均 AUC 介于 0.85 至 0.87。这些结果优于其他使用 UI-RR 的研究。大量实验证实了利用语言与视觉信息的多模态全局局部表示分类肺部病变结果的一致性。
引用
@article{arxiv.2301.10951,
title = {Cross Modal Global Local Representation Learning from Radiology Reports and X-Ray Chest Images},
author = {Nathan Hadjiyski and Ali Vosoughi and Axel Wismueller},
journal= {arXiv preprint arXiv:2301.10951},
year = {2023}
}
备注
Accepted to Computer-Aided Diagnosis, SPIE Medical Imaging 2023