MedFILIP:医用细粒度语言-图像预训练
计算机视觉与模式识别
2025-01-22 v1 人工智能
摘要
医用视觉-语言预训练(VLP)通过利用自然配对的医学图像-报告数据至关重要,用于医学图像分析。然而,现有方法在准确刻画图像与疾病之间的关联方面存在困难,导致诊断结果不准确或不完整。本文提出了MedFILIP,一种细粒度VLP模型,通过对比学习引入医学图像特定知识,具体包括:1) 提出一种基于大型语言模型的信息提取器,用于从报告中解耦全面疾病细节,通过灵活的提示工程提取疾病信息,从而在极小的成本下有效减少文本复杂度,同时保留丰富信息;2) 提出一种知识注入器,用于构建类别与视觉属性之间的关系,帮助模型基于图像特征做出判断,并促进对 unfamiliar 疾病类别的知识外推;3) 提出基于细粒度标注的语义相似度矩阵,提供更平滑、信息更丰富的标签,从而实现细粒度的图像-文本对齐。我们在多个数据集上验证了MedFILIP,例如RSNA-Pneumonia、NIH ChestX-ray14、VinBigData和COVID-19。对于单标签、多标签和细粒度分类,本模型实现了最先进的性能,分类准确率提升了最大6.69%。代码已公开于https://github.com/PerceptionComputingLab/MedFILIP。
关键词
引用
@article{arxiv.2501.10775,
title = {MedFILIP: Medical Fine-grained Language-Image Pre-training},
author = {Xinjie Liang and Xiangyu Li and Fanding Li and Jie Jiang and Qing Dong and Wei Wang and Kuanquan Wang and Suyu Dong and Gongning Luo and Shuo Li},
journal= {arXiv preprint arXiv:2501.10775},
year = {2025}
}
备注
10 pages, 5 figures, IEEE Journal of Biomedical and Health Informatics 2025