适配视觉-语言模型以实现医学图像中的可泛化异常检测
计算机视觉与模式识别
2024-03-20 v1
摘要
大规模视觉-语言预训练模型的最新进展推动了自然图像领域零/少样本异常检测的显著进步。然而,自然图像与医学图像之间的巨大领域差异限制了这些方法在医学异常检测中的有效性。本文引入了一种新颖的轻量级多层次适配与比较框架,以重新利用CLIP模型进行医学异常检测。我们的方法将多个残差适配器集成到预训练的视觉编码器中,实现不同层次视觉特征的逐步增强。这种多层次适配由多层次、像素级的视觉-语言特征对齐损失函数引导,将模型的关注点从自然图像中的物体语义重新校准到医学图像中的异常识别。适配后的特征在各种医学数据类型上展现出更强的泛化能力,即使在模型训练期间未见过医学模态和解剖区域的零样本场景中也是如此。我们在医学异常检测基准上的实验表明,我们的方法显著超越了当前最先进的模型,在零样本和少样本设置下,异常分类的平均AUC分别提升了6.24%和7.33%,异常分割的平均AUC分别提升了2.03%和2.37%。源代码可在以下链接获取:https://github.com/MediaBrain-SJTU/MVFA-AD
引用
@article{arxiv.2403.12570,
title = {Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical Images},
author = {Chaoqin Huang and Aofan Jiang and Jinghao Feng and Ya Zhang and Xinchao Wang and Yanfeng Wang},
journal= {arXiv preprint arXiv:2403.12570},
year = {2024}
}
备注
CVPR 2024