大规模医学视觉任务适配基准
计算机视觉与模式识别
2024-04-22 v1 人工智能
机器学习
摘要
视觉任务适配已被证明能够使用专门的易学习层或令牌,有效地将预训练的Vision Transformers适应到一般下游视觉任务中。然而,目前仍然缺乏大规模基准来充分探索视觉任务适配在现实且重要的医学领域中的效果,特别是在跨多种医学视觉模态(如彩色图像、X射线和CT)方面。为了弥补这一差距,我们提出了Med-VTAB,一个大规模医学视觉任务适配基准,包含针对不同器官、模态和适配方法的168万张医学图像。基于Med-VTAB,我们探索了关于可调参数的医学提示调优的缩放规律,以及使用非医学/医学预训练权重的医学视觉适配的泛化能力。此外,我们研究了患者ID分布外对医学视觉适配的影响,这是一个真实且具有挑战性的场景。此外,Med-VTAB的结果表明,单一预训练模型在医学任务适配方面存在不足。因此,我们引入了GMoE-Adapter,这是一种通过门控混合专家适配器结合医学和通用预训练权重的新方法,在医学视觉任务适配中取得了最先进的结果。
引用
@article{arxiv.2404.12876,
title = {A Large-scale Medical Visual Task Adaptation Benchmark},
author = {Shentong Mo and Xufang Luo and Yansen Wang and Dongsheng Li},
journal= {arXiv preprint arXiv:2404.12876},
year = {2024}
}