中文

KPL:面向视觉-语言模型的训练-free 医学知识挖掘

计算机视觉与模式识别 2025-01-22 v1

摘要

视觉语言模型如 CLIP 因大规模图像-文本预训练在图像识别方面表现突出。然而,将 CLIP 推理应用于零样本分类,尤其是医学图像诊断,面临以下挑战:1) 仅用单一类别名称无法充分表示图像类别;2) CLIP 编码器生成的视觉与文本空间之间存在模态鸿沟。尽管尝试通过大语言模型丰富疾病描述,但缺乏类别特定知识常导致性能不佳。此外,实证证据表明,现有代理学习方法在自然图像数据集上进行的零样本图像分类在医学数据集上表现不稳定。为解决这些问题,我们提出 Knowledge Proxy Learning (KPL) 通过从 CLIP 挖掘知识。KPL 旨在通过 Text Proxy Optimization 和 Multimodal Proxy Learning 利用 CLIP 的多模态理解进行医学图像分类。具体而言,KPL 从构建的知识增强基准中检索图像相关知识描述,以丰富语义文本代理。随后,我们利用输入图像和这些描述经 CLIP 编码生成稳定的多模态代理,以提升零样本分类性能。在医学和自然图像数据集上的大量实验表明,KPL 能够实现有效的零样本图像分类,优于所有基线方法。这些发现凸显了从 CLIP 挖掘知识用于医学图像分类及更广泛领域的潜力。

关键词

引用

@article{arxiv.2501.11231,
  title  = {KPL: Training-Free Medical Knowledge Mining of Vision-Language Models},
  author = {Jiaxiang Liu and Tianxiang Hu and Jiawei Du and Ruiyuan Zhang and Joey Tianyi Zhou and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2501.11231},
  year   = {2025}
}

备注

AAAI(Oral)