ProtoCLIP: 原型对齐的稳健零样类胸部 X 光分类
机器学习
2026-04-21 v1 人工智能
计算机视觉与模式识别
摘要
零样本视觉语言模型 (VLM) 在胸部 X 光片分类中显示出前景,但性能常受制于标签共现混淆、长尾类别不平衡以及在域移情况下的传递不稳定性。我们提出 ProtoCLIP,一种针对 CLIP 类 VLM 的细化策略,通过针对性数据精选和蒸馏锚点对齐来提高零样本判别能力。具体而言,我们构建以病理为导向的训练子集,包含精选的负样本以减少共现偏差。我们还引入一种保持表征的蒸馏目标,以稳定适应性,同时保持语义结构并提高临床相关共现病灶的判别能力。在未使用的 VinDr-CXR 数据集上评估,ProtoCLIP 在多个发现领域的 AUC 提高了 2-10 个百分点。针对肺胸腔积液,ProtoCLIP 实现了最高达 0.94 的 SOTA AUC。这些结果表明,锚点引导的细化结合精选监督和受控适应,能够在不要求大规模再训练的情况下缓解医学 VLM 中常见的零样本传递故障。
引用
@article{arxiv.2604.18444,
title = {ProtoCLIP: Prototype-Aligned Latent Refinement for Robust Zero-Shot Chest X-Ray Classification},
author = {Florian Kittler and Sheethal Bhat and Andreas Maier},
journal= {arXiv preprint arXiv:2604.18444},
year = {2026}
}