PMC-CLIP:基于生物医学文献的对比语言-图像预训练
计算机视觉与模式识别
2023-03-14 v1 计算与语言
机器学习
多媒体
摘要
在大规模数据集上训练的基础模型近期在 CV 与 NLP 中激增。相比之下,由于数据稀缺,生物医学领域的发展远远落后。为解决此问题,我们构建并发布了 PMC-OA,一个从 PubMedCentral 的 OpenAccess 子集中收集的含 1.6M 图像-描述对生物医学数据集,其规模为此前的 8 倍。PMC-OA 涵盖多种模态或疾病,且大多数图像-描述样本在更细粒度(即子图与子说明)上对齐。在 PMC-OA 上以 CLIP 风格预训练时,我们的模型 PMC-CLIP 在各种下游任务上取得最先进结果,包括 ROCO 上的图像-文本检索、MedMNIST 图像分类、医学 VQA,即图像-文本检索上 +8.1% R@10、图像分类上 +3.9% 准确率。
引用
@article{arxiv.2303.07240,
title = {PMC-CLIP: Contrastive Language-Image Pre-training using Biomedical Documents},
author = {Weixiong Lin and Ziheng Zhao and Xiaoman Zhang and Chaoyi Wu and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2303.07240},
year = {2023}
}
备注
10 pages, 3 figures