零样例 3D 医学图像诊断的桥接语义对齐
计算机视觉与模式识别
2025-11-12 v2
摘要
3D 医学图像(如计算机断层扫描)在临床实践中广泛使用,具有巨大的自动诊断潜力。基于监督学习的方法取得了显著进展,但严重依赖大量手动标注,受限于训练数据的可用性和异常类型多样性。视觉语言对齐(VLA)提供了一条在无需额外标注的情况下实现零样学习的有前景的替代方案。然而,我们经验上发现,现有 VLA 方法进行对齐后的视觉和文本嵌入形成两个分离的聚类,呈现出巨大的可桥接差距。为桥接这一差距,我们提出了桥接语义对齐(BrgSA)框架。首先,我们利用大语言模型对报告进行语义总结,提取高层次语义信息。其次,我们设计了跨模态知识交互模块,利用跨模态知识库作为语义桥梁,促进两种模态之间的交互,缩小差距并提高对齐度。为全面评估我们的方法,我们构建了一个包含 15 种欠代表性异常的基准数据集,同时利用了两个现有基准数据集。实验结果表明,BrgSA 在两个公共基准数据集和我们自定义标注数据集上实现了零样诊断中欠代表性异常的显著提升,实现了最先进的性能。
引用
@article{arxiv.2501.03565,
title = {Bridged Semantic Alignment for Zero-shot 3D Medical Image Diagnosis},
author = {Haoran Lai and Zihang Jiang and Qingsong Yao and Rongsheng Wang and Zhiyang He and Xiaodong Tao and Weifu Lv and Wei Wei and S. Kevin Zhou},
journal= {arXiv preprint arXiv:2501.03565},
year = {2025}
}