LVM-Med:通过二阶图匹配学习用于医学影像的大规模自监督视觉模型
计算机视觉与模式识别
2023-11-21 v3
摘要
获得可用有限标注样本微调到新任务的大规模预训练模型,一直是医学影像数据的一个开放挑战。虽然在 ImageNet 上预训练的深度网络以及基于网络规模数据训练的视觉-语言基础模型是主流方法,但由于自然图像与医学图像之间的显著领域偏移,它们在医学任务上的有效性有限。为弥补这一差距,我们引入 LVM-Med,首个在大规模医学数据集上训练的深度网络系列。我们从 55 个公开可用数据集中收集了约 130 万张医学图像,覆盖大量器官和模态,如 CT、MRI、X 射线和超声。我们在此数据集上基准测试了几种最先进的自监督算法,并提出了一种使用图匹配公式的新颖自监督对比学习算法。该方法作出三点贡献:(i)它整合了基于局部和全局信息的先验成对图像相似性度量;(ii)它通过组合图匹配目标构造的损失函数捕获特征嵌入的结构约束;以及(iii)它可使用现代黑盒求解器的梯度估计技术进行高效的端到端训练。我们在 15 个下游医学任务上彻底评估了所提出的 LVM-Med,范围从分割和分类到目标检测,并涵盖分布内与分布外设置。LVM-Med 在经验上优于许多最先进的监督、自监督和基础模型。对于脑肿瘤分类或糖尿病视网膜病变分级等挑战性任务,LVM-Med 在使用仅 ResNet-50 的情况下,比在 10 亿掩码上训练的先前视觉-语言模型提高 6-7%。
引用
@article{arxiv.2306.11925,
title = {LVM-Med: Learning Large-Scale Self-Supervised Vision Models for Medical Imaging via Second-order Graph Matching},
author = {Duy M. H. Nguyen and Hoang Nguyen and Nghiem T. Diep and Tan N. Pham and Tri Cao and Binh T. Nguyen and Paul Swoboda and Nhat Ho and Shadi Albarqouni and Pengtao Xie and Daniel Sonntag and Mathias Niepert},
journal= {arXiv preprint arXiv:2306.11925},
year = {2023}
}
备注
Accepted at NeurIPS 2023