中文

面向 3D 医学图像理解的综合语言-图像预训练

计算机视觉与模式识别 2026-01-15 v2 机器学习

摘要

视觉-语言预训练,即将图像与配对文本对齐,是一种强大的范式,用于创建可直接用于分类、检索和分割等任务的编码器。在 3D 医学图像领域,这些能力允许视觉-语言编码器 (VLE) 为放射科医生提供相似异常的患者检索、异常发生概率预测,或通过下游适配生成放射学报告的功能。尽管该方法前景光明,但数据可获得性和领域特定障碍限制了当前 3D VLE 的能力。本文通过注入 report generation 目标的额外监督,并结合视觉-语言与视觉-only 预训练来克服这些挑战。这使我们能够利用图像-only 和配对图像-文本 3D 数据集,增加模型暴露的数据总量。通过这些额外目标以及 3D 医学影像领域的最佳实践,我们开发了综合语言-图像预训练 (COLIPRI) 编码器系列。我们的 COLIPRI 编码器在 report generation、语义分割、分类探测和 zero-shot 分类中实现了最先进的性能。该模型已发布于 https://huggingface.co/microsoft/colipri。

关键词

引用

@article{arxiv.2510.15042,
  title  = {Comprehensive language-image pre-training for 3D medical image understanding},
  author = {Tassilo Wald and Ibrahim Ethem Hamamci and Yuan Gao and Sam Bond-Taylor and Harshita Sharma and Maximilian Ilse and Cynthia Lo and Olesya Melnichenko and Anton Schwaighofer and Noel C. F. Codella and Maria Teodora Wetscherek and Klaus H. Maier-Hein and Panagiotis Korfiatis and Valentina Salvatelli and Javier Alvarez-Valle and Fernando Pérez-García},
  journal= {arXiv preprint arXiv:2510.15042},
  year   = {2026}
}