基于CS-UNet的迁移学习用于微观结构分割:一种融合Transformer与CNN编码器的混合算法
计算机视觉与模式识别
2023-08-29 v1 材料科学
摘要
迁移学习通过使用在更大数据集上预训练的参数为深度学习模型初始化来提升其性能。直观上,当预训练在同源数据集上时迁移学习更有效。NASA最近的一项研究表明,采用编码器-解码器算法的微观结构分割从在显微图像上预训练的CNN编码器获益多于从在自然图像上预训练的编码器。然而,CNN模型仅捕捉图像中的局部空间关系。近年来,诸如Transformer的注意力网络越来越多地用于图像分析以捕捉像素间的长程关系。在本研究中,我们比较了在显微图像上预训练的Transformer与CNN模型同那些在自然图像上预训练的模型在分割性能上的差异。我们的结果部分证实了NASA的研究:当在显微图像上预训练时,分布外图像(在不同成像与样品条件下获取)的分割性能得到显著提升。然而,对于一次性与少样本学习,Transformer带来的性能增益较为有限。我们还发现,对于图像分割,预训练Transformer与CNN编码器的组合始终优于单独使用预训练CNN编码器。我们的数据集(约50,000张图像)将NASA数据集的公开部分与我们额外收集的图像相结合。即便训练数据少得多,我们的预训练模型在图像分割上仍具有显著更优的性能。该结果表明Transformer与CNN互为补充,且在显微图像上预训练时对下游任务更有裨益。
引用
@article{arxiv.2308.13917,
title = {Transfer Learning for Microstructure Segmentation with CS-UNet: A Hybrid Algorithm with Transformer and CNN Encoders},
author = {Khaled Alrfou and Tian Zhao and Amir Kordijazi},
journal= {arXiv preprint arXiv:2308.13917},
year = {2023}
}
备注
21 pages, 8 figures, 11 tables