中文

Uni-Mlip:医学视觉语言预训练的统一自监督

计算机视觉与模式识别 2024-11-26 v1 人工智能 计算与语言 机器学习

摘要

近期通过对比学习进行视觉语言预训练的进展显著提高了计算机视觉任务上的性能。然而,在医学领域,获取多模态数据往往昂贵且具有挑战性 due to 隐私、敏感性和注释复杂性。为缓解数据稀缺的同时提升模型性能,我们引入了 Uni-Mlip,这是一个专为增强医学视觉语言预训练而设计的统一自监督框架。Uni-Mlip 在数据层面和特征层面无缝集成跨模态、单模态和融合模态自监督技术。此外,Uni-Mlip 针对医学图像的独特特征定制了单模态图像自监督。我们在规模不同的数据集上进行的实验表明,Uni-Mlip 在三个关键下游任务中显著优于当前最先进的方法:图像-文本检索、图像分类和视觉问答 (VQA)。

引用

@article{arxiv.2411.15207,
  title  = {Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training},
  author = {Ameera Bawazir and Kebin Wu and Wenbin Li},
  journal= {arXiv preprint arXiv:2411.15207},
  year   = {2024}
}

备注

15 pages, 2 figures, accepted by BMVC'24