用于肝脏局灶性病变分类的视觉-语言模型
计算机视觉与模式识别
2025-05-07 v1
摘要
肝脏局灶性病变的准确分类对于肝病学的诊断和治疗至关重要。然而,传统的监督式深度学习模型依赖于大规模标注数据集,这在医学影像中通常受限。最近,视觉-语言模型 (VLM),例如对比语言-图像预训练模型 (CLIP),已被应用于图像分类。与仅基于视觉信息对图像进行分类的传统卷积神经网络 (CNN) 相比,VLM 利用文本和图像的多模态学习,使其即使在标注数据量有限的情况下也能有效学习。受 CLIP 启发,我们提出了一种专门为肝脏局灶性病变 (FLLs) 分类设计的模型 Liver-VLM。首先,Liver-VLM 将类别信息整合到文本编码器中,而无需引入额外的推理开销。其次,通过计算图像和文本嵌入之间的成对余弦相似度,并使用交叉熵损失优化模型,Liver-VLM 有效地将图像特征与类别级文本特征对齐。在 MPCT-FLLs 数据集上的实验结果表明,Liver-VLM 模型在准确率和曲线下面积 (AUC) 方面均优于标准的 CLIP 和 MedCLIP 模型。进一步分析表明,使用轻量级的 ResNet18 骨干网络能提升分类性能,尤其是在数据受限的条件下。
引用
@article{arxiv.2505.03350,
title = {A Vision-Language Model for Focal Liver Lesion Classification},
author = {Song Jian and Hu Yuchang and Wang Hui and Chen Yen-Wei},
journal= {arXiv preprint arXiv:2505.03350},
year = {2025}
}
备注
9 pages,4 figures, 4 tables,Innovation in Medicine and Healthcare Proceedings of 13th KES-InMed 2025