面向医学图像的资源高效域自适应预训练
图像与视频处理
2022-04-29 v1 计算机视觉与模式识别
神经与进化计算
摘要
基于深度学习的医学图像分析因标注成本高和隐私问题而受限于数据稀缺。该领域研究者采用迁移学习以在使用复杂架构时避免过拟合。然而,预训练与下游数据间的域差异阻碍了下游任务性能。近期一些研究成功使用域自适应预训练(DAPT)来解决此问题。在 DAPT 中,模型以通用数据集预训练权重初始化,并使用中等规模的域内数据集(医学图像)进一步预训练。尽管该技术在下游任务的准确率和鲁棒性上取得了良好结果,但即便 DAPT 数据集规模中等,其计算开销也很大。这些计算密集型技术与模型对环境产生负面影响,并为资源有限的研究者制造了不平等的竞争环境。本研究提出了计算高效的 DAPT,且不牺牲下游准确率与鲁棒性。为此,本研究提出三种技术:第一种(部分 DAPT)在层的子集上执行 DAPT;第二种采用混合策略(混合 DAPT),即先进行若干轮次的部分 DAPT,再对剩余轮次进行完整 DAPT;第三种在基架构的简化变体上执行 DAPT。结果表明,与标准 DAPT(完整 DAPT)相比,混合 DAPT 技术在开发集和外部数据集上取得了更优性能。相比之下,简化架构(经 DAPT 后)在开发集上取得适中性能的同时,实现了最佳鲁棒性。
引用
@article{arxiv.2204.13280,
title = {Resource-efficient domain adaptive pre-training for medical images},
author = {Yasar Mehmood and Usama Ijaz Bajwa and Xianfang Sun},
journal= {arXiv preprint arXiv:2204.13280},
year = {2022}
}