将 CLIP 引入临床:用于医学分析的动态软标签与否定感知学习
计算机视觉与模式识别
2025-05-29 v1
摘要
大规模图文对数据集的发展极大地推动了视觉语言处理 (VLP) 中的自监督学习。然而,将 CLIP 等通用领域架构直接应用于医学数据会带来挑战,特别是在处理否定表述以及应对医学数据集固有的数据不平衡方面。为了解决这些问题,我们提出了一种新颖的方法,将临床增强的动态软标签与医学图像对齐相结合,从而提高了临床理解能力以及对比损失在医学语境中的适用性。此外,我们引入了基于否定的困难负样本,以加深模型对临床语言复杂性的理解。我们的方法易于集成到医学 CLIP 训练流程中,并在零样本、微调分类和报告检索等多个任务上取得了 SOTA 性能。为了全面评估模型理解临床语言的能力,我们引入了 CXR-Align,这是一个专门设计的基准,用于评估对胸部 X 射线 (CXR) 数据集中否定和临床信息的理解能力。实验结果表明,我们提出的方法易于实现,并能有效泛化到各种对比学习框架中,从而增强了医学 VLP 能力并推动了医学影像中的临床语言理解。
引用
@article{arxiv.2505.22079,
title = {Bringing CLIP to the Clinic: Dynamic Soft Labels and Negation-Aware Learning for Medical Analysis},
author = {Hanbin Ko and Chang-Min Park},
journal= {arXiv preprint arXiv:2505.22079},
year = {2025}
}
备注
16 pages (8 main, 2 references, 6 appendix), 13 figures. Accepted to CVPR 2025. This author-accepted manuscript includes an expanded ethics/data user agreement section. The final version will appear in the Proceedings of CVPR 2025