面向脑部异常的医学视觉-语言预训练
计算与语言
2024-04-30 v1
摘要
视觉-语言模型在需要理解视觉和语言元素的任务中变得越来越强大,弥合了这些模态之间的差距。在多模态临床 AI 的背景下,对具备特定领域知识的模型的需求日益增长,因为现有模型通常缺乏医疗应用所需的专业知识。在本文中,我们以脑部异常为例,演示如何从 PubMed 等公共资源自动收集医学图文对齐数据用于预训练。具体而言,我们提出了一种流水线,通过最初从病例报告和已发表期刊收集大型脑部图文数据集,随后构建针对特定医疗任务的高性能视觉-语言模型,来简化预训练过程。我们还研究了医学领域中子图与子标题匹配的独特挑战。我们通过定量和定性的内在评估对生成的模型进行了评估。生成的数据集和我们的代码可在 https://github.com/masoud-monajati/MedVL_pretraining_pipeline 找到。
引用
@article{arxiv.2404.17779,
title = {Medical Vision-Language Pre-Training for Brain Abnormalities},
author = {Masoud Monajatipoor and Zi-Yi Dou and Aichi Chien and Nanyun Peng and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2404.17779},
year = {2024}
}