中文

面向 3D 医学影像的可扩展语言-图像预训练

计算机视觉与模式识别 2026-02-20 v3

摘要

当前面向 3D 医学影像(如 CT 和 MRI)的语言-图像预训练的可扩展性,受限于放射科医师手动整理原始临床研究的需求。在本工作中,我们开创性地直接在未整理的研究上进行预训练,这不仅更贴近放射科医师的工作流程,也提供了通向可扩展性的自然路径。然而,此类数据的独特结构为现有模型架构带来了新的挑战,这些架构最初是为 2D 切片或单次 3D 扫描设计的。为此,我们引入了一种受放射学数据内在层级结构(切片、扫描、研究)启发的新型分层注意力机制。我们将我们的框架称为用于语言-图像预训练的分层注意力机制(HLIP)。HLIP 在包含 220K 项研究(含 313 万次脑部 MRI 扫描)和 240K 项研究(含 144 万次头部 CT 扫描)的数据上进行了训练,实现了 SOTA 性能,例如在提出的公开脑部 MRI 基准 Pub-Brain-5 上 balanced ACC 提升 10.5%;在头部 CT 基准 CQ500 和 RSNA 上 macro AUC 分别提升 8.3% 和 1.7%。HLIP 在现有的 3D 医学语言-图像预训练基准上也展现出强大的泛化能力,例如在 CT-RATE 上预训练后,在 Rad-ChestCT 基准上 macro AUC 提升 4.3%。这些结果表明,借助 HLIP,直接在未整理的临床数据集上进行预训练,是 3D 医学影像语言-图像预训练的一个可扩展且有效的方向。代码可在 https://github.com/Zch0414/hlip 获取。

关键词

引用

@article{arxiv.2505.21862,
  title  = {Towards Scalable Language-Image Pre-training for 3D Medical Imaging},
  author = {Chenhui Zhao and Yiwei Lyu and Asadur Chowdury and Edward Harake and Akhil Kondepudi and Akshay Rao and Xinhai Hou and Honglak Lee and Todd Hollon},
  journal= {arXiv preprint arXiv:2505.21862},
  year   = {2026}
}

备注

TMLR 2026