中文

Med-Flamingo:一种多模态医学少样本学习器

计算机视觉与模式识别 2023-07-31 v1 人工智能

摘要

医学就其本质而言是一个需要跨多种模态综合信息的多面领域。医学生成式视觉-语言模型(VLM)朝此方向迈出第一步,并有望带来诸多令人振奋的临床应用。然而,现有模型通常需在规模可观的下游数据集上微调,这构成一大局限,因为在许多医学应用中数据稀缺,亟需能够实时从少量示例中学习的模型。在此我们提出 Med-Flamingo,一种适配医学领域的多模态少样本学习器。基于 OpenFlamingo-9B,我们在来自论文与教科书的配对及交错医学图像-文本数据上继续预训练。Med-Flamingo 解锁了少样本生成式医学视觉问答(VQA)能力,我们在多个数据集上进行了评估,包括一个新颖且具有挑战性的视觉 USMLE 风格问题的开放式 VQA 数据集。此外,我们开展了首个生成式医学 VQA 的人类评估,由医师在一个交互式应用中审阅问题与被盲法处理的生成结果。Med-Flamingo 在临床医师评分中将生成式医学 VQA 性能提升高达 20%,并首次实现了多模态医学少样本适配,例如推理生成。我们在 https://github.com/snap-stanford/med-flamingo 发布了我们的模型、代码与评估应用。

关键词

引用

@article{arxiv.2307.15189,
  title  = {Med-Flamingo: a Multimodal Medical Few-shot Learner},
  author = {Michael Moor and Qian Huang and Shirley Wu and Michihiro Yasunaga and Cyril Zakka and Yash Dalmia and Eduardo Pontes Reis and Pranav Rajpurkar and Jure Leskovec},
  journal= {arXiv preprint arXiv:2307.15189},
  year   = {2023}
}

备注

Preprint