提高高分辨率医学图像分类迁移学习内存效率的提升方法
计算机视觉与模式识别
2025-07-17 v3
摘要
大规模预训练模型的成功已使微调成为实现下游任务显著性改进的标准方法。然而,对预训练模型的整个参数进行微调代价高昂。参数高效迁移学习 (PETL) 最近作为一种高性价比的替代方案,旨在适应预训练模型以应对下游任务。尽管具有上述优势,但不断增大的模型规模和输入分辨率为 PETL 带来了挑战,因为训练内存消耗的减少并不像参数使用那样有效。在本文中,我们引入了 Fine-grained Prompt Tuning plus (FPT+),这是一种专为高分辨率医学图像分类设计的 PETL 方法,显著降低了其他 PETL 方法所需的训练内存消耗。FPT+ 通过训练轻量侧网络并通过细粒度提示和融合模块从大预训练模型 (LPM) 中访问预训练知识来实现迁移学习。具体而言,我们冻结感兴趣的 LPM 并构建可学习的轻量侧网络。冻结的 LPM 处理高分辨率图像以提取细粒度特征,而侧网络使用相应的下采样低分辨率图像以最小化内存使用。为使侧网络能够利用预训练知识,我们提出细粒度提示和融合模块,这些模块协同工作通过 LPM 的中间激活来总结信息。我们在八个大小、模态和复杂度各异的医学图像数据集上评估了 FPT+。实验结果表明,FPT+ 在使用仅占训练整个 ViT-B 模型可学习参数的 1.03% 和内存的 3.18% 的情况下,优于其他 PETL 方法。我们的代码可在 https://github.com/YijinHuang/FPT 上获取。
引用
@article{arxiv.2408.02426,
title = {Boosting Memory Efficiency in Transfer Learning for High-Resolution Medical Image Classification},
author = {Yijin Huang and Pujin Cheng and Roger Tam and Xiaoying Tang},
journal= {arXiv preprint arXiv:2408.02426},
year = {2025}
}