EMIXER:基于自监督的端到端多模态X射线生成
图像与视频处理
2021-01-19 v2 计算机视觉与模式识别
机器学习
摘要
深度生成模型已实现多样化应用中的高质量数据自动合成。然而,最有效的生成模型专用于单一领域的数据(如图像或文本)。医疗等现实应用需要来自多个领域的多模态数据(例如图像与相应文本),由于可用性有限和隐私问题,这类数据难以获取,也更难合成。为应对这一联合合成挑战,我们提出一种端到端多模态X射线生成模型(EMIXER),用于联合合成X射线图像与相应的自由文本报告,均以诊断标签为条件。EMIXER是一种条件生成对抗模型,通过以下方式实现:1)基于标签生成图像,2)将图像编码为隐藏嵌入,3)通过分层解码器从图像嵌入生成相应文本,4)使用联合判别器评估图像与相应文本。EMIXER还支持自监督,以利用大量无标签数据。使用真实X射线报告数据的大量实验表明,利用合成多模态样本进行数据增强可提升多种监督任务的性能,包括在样本极少情况下的COVID-19 X射线分类。生成的图像与报告质量也由放射科医生确认。我们定量表明,EMIXER生成的合成数据集可增强X射线图像分类与报告生成模型,相比仅用真实数据样本训练的模型分别取得5.94%和6.9%的提升。综上,我们的结果凸显了生成模型在推动临床机器学习方面的前景。
引用
@article{arxiv.2007.05597,
title = {EMIXER: End-to-end Multimodal X-ray Generation via Self-supervision},
author = {Siddharth Biswal and Peiye Zhuang and Ayis Pyrros and Nasir Siddiqui and Sanmi Koyejo and Jimeng Sun},
journal= {arXiv preprint arXiv:2007.05597},
year = {2021}
}