通过跨模态学习中的知识注入增强胸部 X 光分类
计算机视觉与模式识别
2025-02-20 v1 计算与语言
摘要
人工智能在医学影像中的整合展现了巨大潜力,但预训练知识与跨模态学习性能之间的关系仍不明确。本研究探讨了将医学知识显式注入学习过程如何影响跨模态分类的性能,重点关注胸部 X 光(CXR)图像。我们引入了一个新颖的基于集合论的知识注入框架,该框架能够为 CXR 图像生成具有可控知识粒度的描述。利用该框架,我们在包含不同层级医学信息的描述上微调 CLIP 模型。我们通过在 CXR 分类基准数据集 CheXpert 上的零样本分类来评估模型性能。结果表明,注入细粒度的医学知识显著提升了分类准确率,达到 72.5%,而使用人工生成描述时仅为 49.9%。这凸显了领域特定知识在医学跨模态学习中的关键作用。此外,我们探讨了知识密度的影响以及使用领域特定大语言模型生成描述,发现更密集的知识和专用 LLM 有助于提升性能。本研究通过展示知识注入在改进自动化 CXR 分类中的有效性,推进了医学图像分析领域的发展,为更准确可靠的诊断工具铺平了道路。
引用
@article{arxiv.2502.13447,
title = {Enhancing Chest X-ray Classification through Knowledge Injection in Cross-Modality Learning},
author = {Yang Yan and Bingqing Yue and Qiaxuan Li and Man Huang and Jingyu Chen and Zhenzhong Lan},
journal= {arXiv preprint arXiv:2502.13447},
year = {2025}
}
备注
Accepted by ICASSP'25