基于图像-文本对的医学视觉表示对比学习
计算机视觉与模式识别
2022-09-21 v2 计算与语言
机器学习
摘要
学习医学图像(如 X 光)的视觉表示是医学图像理解的核心,但人类标注的稀缺制约了其进展。现有工作通常依赖于从 ImageNet 预训练迁移的权重进行微调,由于图像特征差异巨大此举并非最优;或依赖于从与医学图像配对的文本报告数据中提取基于规则的标签,此法不准确且难以泛化。同时,近期若干研究展示了基于自然图像的无监督对比学习的令人振奋的结果,但我们发现这些方法因医学图像的高类间相似性而助益甚微。我们提出 ConVIRT,一种通过利用自然出现的配对描述性文本来学习医学视觉表示的替代性无监督策略。我们这种通过两模态间双向对比目标用配对文本数据预训练医学图像编码器的新方法是领域无关的,且不需要额外的专家输入。我们通过将预训练权重迁移至 4 项医学图像分类任务与 2 项零样本检索任务来测试 ConVIRT,并表明其产生的图像表示在多数设定下显著优于强基线。值得注意的是,在所有 4 项分类任务中,我们的方法仅需 ImageNet 初始化对应方法十分之一的标注训练数据即可取得更优或相当的性能,展现出卓越的数据效率。
引用
@article{arxiv.2010.00747,
title = {Contrastive Learning of Medical Visual Representations from Paired Images and Text},
author = {Yuhao Zhang and Hang Jiang and Yasuhide Miura and Christopher D. Manning and Curtis P. Langlotz},
journal= {arXiv preprint arXiv:2010.00747},
year = {2022}
}
备注
First published in 2020. Accepted at Machine Learning for Healthcare (MLHC) 2022