通过微调预训练图像-文本编码器显著改善零样本 X 射线病理分类
机器学习
2024-10-14 v3 计算机视觉与模式识别
图像与视频处理
摘要
深度神经网络越来越多地用于医学影像中的病理分类等任务,但由于高质量、专家标注训练数据的稀缺而面临挑战。近期研究利用 CLIP 等预训练对比图像-文本模型,通过使用胸部 X 射线图像及相应报告微调模型来适配医学用途,以实现零样本病理分类,从而无需病理特异性标注。然而,多数研究仍沿用通用领域相同的对比学习目标,忽视了医学图像-报告对的多标签性质。本文提出一种包含正对损失松弛和随机句子采样的新型微调策略。我们旨在不依赖外部知识的情况下提升零样本病理分类性能。我们的方法可应用于任何预训练对比图像-文本编码器,并因未使用外部数据而无需进一步训练即可轻松迁移至域外数据集。我们的方法在四个胸部 X 射线数据集和三个预训练模型上持续提升了整体零样本病理分类性能,平均宏 AUROC 提升 4.3%。此外,我们的方法优于当前最优方法,并在 CheXpert 数据集的五类竞赛病理的零样本分类中略微超越获委员会认证的放射科医生。
引用
@article{arxiv.2212.07050,
title = {Significantly improving zero-shot X-ray pathology classification via fine-tuning pre-trained image-text encoders},
author = {Jongseong Jang and Daeun Kyung and Seung Hwan Kim and Honglak Lee and Kyunghoon Bae and Edward Choi},
journal= {arXiv preprint arXiv:2212.07050},
year = {2024}
}