中文

MV-MLM:构建多视角乳腺钼片与语言模型的桥梁,用于乳腺癌诊断与风险预测

计算机视觉与模式识别 2025-10-31 v1 人工智能

摘要

大规模带精细标注的数据集是训练健壮的乳腺癌检测或风险预测计算机辅助诊断 (CAD) 模型的关键。然而,获取具有细致标注的数据集既昂贵又耗时。视觉-语言模型 (VLM) 如 CLIP,这些模型是在大规模图像-文本对上预训练的,为医学影像任务提供了提高鲁棒性和数据效率的有前景的解决方案。本文引入一种新型多视角乳腺钼片语言模型用于乳腺癌分类和风险预测,该模型在成对的乳腺钼片图像和合成放射科报告数据集上训练。我们的 MV-MLM 利用多视角监督信息,通过跨模态自监督学习从大量放射科数据中学习丰富的表征,包括多个视角及其对应的伪放射科报告。我们提出一种新颖的联合视觉-文本学习策略,以增强在不同数据类型和任务上的泛化和准确性性能,区分乳腺组织或癌症特征(钙化、肿块),并利用这些模式理解乳腺钼片图像并预测癌症风险。我们在公共和私有数据集上对该方法进行了评估,结果表明该模型在三个分类任务中实现了最先进的性能:(1)恶性良性分类,(2)亚型分类,(3)基于图像的癌症风险预测。此外,模型在没有实际放射科报告的情况下,仅使用合成文本报告训练即可在数据效率方面显著优于现有的全监督或 VLM 框架。

关键词

引用

@article{arxiv.2510.26151,
  title  = {MV-MLM: Bridging Multi-View Mammography and Language for Breast Cancer Diagnosis and Risk Prediction},
  author = {Shunjie-Fabian Zheng and Hyeonjun Lee and Thijs Kooi and Ali Diba},
  journal= {arXiv preprint arXiv:2510.26151},
  year   = {2025}
}

备注

Accepted to Computer Vision for Automated Medical Diagnosis (CVAMD) Workshop at ICCV 2025