中文

基于混合数据的胸部X光自监督图像-文本预训练

计算机视觉与模式识别 2021-03-31 v1

摘要

预训练模型(例如来自ImageNet的模型)已被证明能有效提升许多下游应用的性能。为医学影像构建此类模型需要获取大规模标注,成本过高。与此同时,医院信息系统中存储了大量临床数据(以图像和文本报告形式存在)。同一患者检查中的配对图像-文本数据可用于以弱监督方式进行预训练任务。然而,这类原始数据的完整性、可获取性和数量在不同机构间差异很大,例如配对与未配对(仅图像或仅文本)数据。在本工作中,我们引入了一种图像-文本预训练框架,能够从这些具有混合数据输入(即配对图像-文本数据、配对与未配对数据的混合)的原始数据中学习。未配对数据可来源于一个或多个机构(例如来自一个机构的图像与来自另一个机构的文本相耦合)。具体而言,我们提出了一种基于transformer的训练框架,用于联合学习图像与文本数据的表示。除现有的掩码语言建模外,我们引入了多尺度掩码视觉建模作为图像块重建的自监督训练任务。我们不仅证明了跨混合数据输入进行预训练的可行性,还展示了在3种胸部X光应用中采用此类预训练模型的益处,即分类、检索和图像重建。在使用MIMIC-CXR、NIH14-CXR和OpenI-CXR数据集与先前最优方法对比中,报告了更优结果。

关键词

引用

@article{arxiv.2103.16022,
  title  = {Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays},
  author = {Xiaosong Wang and Ziyue Xu and Leo Tam and Dong Yang and Daguang Xu},
  journal= {arXiv preprint arXiv:2103.16022},
  year   = {2021}
}