语言引导公共语义空间中的统一医学图像预训练
计算机视觉与模式识别
2024-07-08 v2
摘要
视觉-语言预训练(Vision-Language Pre-training, VLP)通过利用医学图像与其对应报告之间的语义一致性,展现了分析医学图像的优势。它能高效学习视觉表征,进而促进对复杂影像数据的增强分析与解读。然而,这一观察主要基于单模态数据(多为X射线等2D图像)得到验证,将VLP适配于真实场景中学习医学图像的统一表征仍是一项开放挑战。这源于医学图像常涵盖多种模态,尤其是具有不同维度数量的模态(如计算机断层扫描等3D图像)。为克服上述挑战,我们提出一种统一医学图像预训练框架,即UniMedI,其利用诊断报告作为公共语义空间,为多种模态的医学图像(尤其是2D与3D图像)创建统一表征。在文本引导下,我们有效揭示视觉模态信息,定位2D X射线中的病灶区域以及复杂3D CT扫描中含病变的切片,最终增强不同医学成像模态间的一致性。为证明UniMedI的有效性与通用性,我们在10个不同数据集的2D与3D图像上评估其性能,涵盖分类、分割与检索等广泛医学图像任务。UniMedI在下游任务中展现出优越性能,表明其在建立通用医学视觉表征方面的有效性。
引用
@article{arxiv.2311.14851,
title = {Unified Medical Image Pre-training in Language-Guided Common Semantic Space},
author = {Xiaoxuan He and Yifan Yang and Xinyang Jiang and Xufang Luo and Haoji Hu and Siyun Zhao and Dongsheng Li and Yuqing Yang and Lili Qiu},
journal= {arXiv preprint arXiv:2311.14851},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2210.06044 by other authors