CLIP 在医学领域视觉问答中的收益是否如同在通用领域一样显著?
计算机视觉与模式识别
2021-12-30 v1 人工智能
计算与语言
机器学习
摘要
对比语言-图像预训练(CLIP)利用从网上收集的大量图像-文本对进行跨模态监督学习,已展现出显著的成功。迄今为止,CLIP 的有效性主要在通用领域的多模态问题中得到研究。本工作评估了 CLIP 在医学视觉问答(MedVQA)任务中的有效性。为此,我们提出了 PubMedCLIP,这是基于 PubMed 文章为医学领域微调的 CLIP 版本。我们的实验在两个 MedVQA 基准数据集上进行,并考察了两种 MedVQA 方法:MEVF(增强视觉特征混合)和 QCR(通过条件推理进行问答)。对于每一种方法,我们评估了使用 PubMedCLIP、原始 CLIP 以及仅在视觉数据上预训练的最先进 MAML(模型无关元学习)网络进行视觉表示学习的优劣。我们开源了 MedVQA 流水线代码以及 PubMedCLIP 的预训练模型。与 MAML 的视觉编码器相比,CLIP 和 PubMedCLIP 均取得了改进。PubMedCLIP 取得了最佳结果,总体准确率提升高达 3%。具体示例展示了 PubMedCLIP 相对于先前广泛使用的 MAML 网络的优势。在 PubMedCLIP 中使用语言监督进行视觉表示学习为 MedVQA 带来了显著提升。我们的实验揭示了两个 MedVQA 基准数据集中先前工作未提及的分布差异,这些差异导致 PubMedCLIP 中不同的后端视觉编码器在这些数据集上表现出不同行为。此外,我们观察到通用领域与医学领域视觉问答的根本性能差异。
引用
@article{arxiv.2112.13906,
title = {Does CLIP Benefit Visual Question Answering in the Medical Domain as Much as it Does in the General Domain?},
author = {Sedigheh Eslami and Gerard de Melo and Christoph Meinel},
journal= {arXiv preprint arXiv:2112.13906},
year = {2021}
}