通过解剖正常性建模提升视觉语义密度用于医学视觉语言预训练
图像与视频处理
2025-08-07 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉语言预训练(VLP)具有开发多功能和通用医学诊断能力的巨大潜力。然而,将信噪比(SNR)较低的医学图像与 SNR 较高的报告进行对齐,导致视觉对齐偏差。本文提出通过提升视觉语义密度来改善对齐效果。一方面,我们通过疾病级别视觉对比学习来增强视觉语义,这加强了模型区分每个解剖结构正常与异常样本的能力。另一方面,我们引入一种解剖正常性建模方法,用于建模每个解剖结构正常样本的分布,利用 VQ-VAE 对正常视觉嵌入在潜在空间中的重建。这一过程通过异常样本中分布迁移的效应放大异常信号,从而增强模型对异常属性的感知和辨别能力。增强后的视觉表征有效地捕获了与诊断相关的语义,促进了与诊断报告更高效、更准确的对齐。我们在两个胸部 CT 数据集(CT-RATE 和 Rad-ChestCT)以及一个腹部 CT 数据集(MedVL-CT69K)上进行了广泛实验,并全面评估了在胸部和腹部 CT 场景下跨多个诊断任务的诊断性能,实现了 SOTA 的零样本性能。值得注意的是,我们的方法在 15 种器官中 54 种疾病的平均 AUC 为 84.9%,显著优于现有方法。此外,我们还展示了所预训练模型的优异迁移学习能力。代码已公开:https://github.com/alibaba-damo-academy/ViSD-Boost。
引用
@article{arxiv.2508.03742,
title = {Boosting Vision Semantic Density with Anatomy Normality Modeling for Medical Vision-language Pre-training},
author = {Weiwei Cao and Jianpeng Zhang and Zhongyi Shui and Sinuo Wang and Zeli Chen and Xi Li and Le Lu and Xianghua Ye and Tingbo Liang and Qi Zhang and Ling Zhang},
journal= {arXiv preprint arXiv:2508.03742},
year = {2025}
}