AViT:将视觉Transformer适配于小规模皮肤病变分割数据集
计算机视觉与模式识别
2024-06-13 v2
摘要
皮肤病变分割(SLS)在皮肤病变分析中起着重要作用。视觉Transformer(ViT)被视为SLS的一种有前景的解决方案,但由于其固有的参数密集型结构以及缺乏某些归纳偏置,与卷积神经网络(CNN)相比需要更多训练数据。为缓解此问题,当前方法在SLS数据集上微调预训练的ViT骨干网络,旨在利用从更大规模自然图像集学到的知识来降低所需的皮肤训练数据量。然而,全面微调大型骨干网络的所有参数在计算上代价高昂且耗费内存。本文提出AViT,一种通过将任意预训练ViT迁移到SLS任务以缓解其数据饥渴问题的新型高效策略。具体而言,我们在Transformer层内集成轻量级模块(适配器),在不更新预训练权重的情况下调制ViT的特征表示。此外,我们采用浅层CNN作为提示生成器,从输入图像创建提示嵌入,以捕获细粒度信息与CNN的归纳偏置,从而指导小规模数据集上的分割任务。我们在4个皮肤病变数据集上的定量实验表明,AViT以显著更少的可训练参数取得了与SOTA相当甚至更优的性能。我们的代码可在 https://github.com/siyi-wind/AViT 获取。
引用
@article{arxiv.2307.13897,
title = {AViT: Adapting Vision Transformers for Small Skin Lesion Segmentation Datasets},
author = {Siyi Du and Nourhan Bayasi and Ghassan Hamarneh and Rafeef Garbi},
journal= {arXiv preprint arXiv:2307.13897},
year = {2024}
}
备注
10 pages, 2 figures, accepted by MICCAI ISIC Workshop 2023