面向医学视觉-语言理解与生成的多模态预训练:基于新基准的实证研究
计算机视觉与模式识别
2023-08-25 v2 人工智能
摘要
随着MSCOCO等大规模、综合性和通用视觉-语言(VL)数据集的可用,视觉-语言预训练(VLP)已成为活跃的研究领域,并被证明对视觉问答等各种VL任务有效。然而,迄今为止医学领域中的VLP研究甚少。为提供医学VL任务VLP的全面视角,我们进行了透彻的实验分析,以研究可能影响统一视觉-语言Transformer的VLP性能的关键因素。为便于做出合理且快速的预训练决策,我们提出RadioGraphy Captions (RGC),一个高质量多模态放射学数据集,包含从开放获取在线数据库MedPix收集的18,434个图像-描述对。RGC可用作预训练数据集或用于医学报告生成和医学图像-文本检索的新基准。通过利用RGC及其他可用数据集进行预训练,我们提出了若干可指导未来医学VLP研究的关键见解,以及用于各种医学VL任务的新强基线。
引用
@article{arxiv.2306.06494,
title = {Multi-modal Pre-training for Medical Vision-language Understanding and Generation: An Empirical Study with A New Benchmark},
author = {Li Xu and Bo Liu and Ameer Hamza Khan and Lu Fan and Xiao-Ming Wu},
journal= {arXiv preprint arXiv:2306.06494},
year = {2023}
}
备注
Published as oral paper in CHIL 2023