Uni4Eye:基于掩码图像建模Transformer的二维与三维统一自监督预训练用于眼科图像分类
图像与视频处理
2022-03-15 v2 计算机视觉与模式识别
摘要
大规模标注数据集是计算机视觉中监督深度学习成功的关键因素。然而,标注数据有限非常常见,尤其在眼科图像分析中,因为人工标注耗时费力。自监督学习(SSL)方法为更好地利用无标注数据带来巨大机遇,因为它们不需要大量标注。为了尽可能使用无标注眼科图像,有必要打破维度壁垒,同时利用二维和三维图像。本文提出一个通用自监督Transformer框架,名为Uni4Eye,以发现眼科图像的固有图像属性并捕获领域特定特征嵌入。Uni4Eye可作为全局特征提取器,其基础建立在带有Vision Transformer(ViT)架构的掩码图像建模任务上。我们采用统一块嵌入模块替换ViT中原始块嵌入模块,以联合处理二维和三维输入图像。此外,我们设计双分支多任务解码器模块,同时对输入图像及其梯度图执行两个重建任务,提供更具判别性的表示以实现更好收敛。我们通过将预训练的Uni4Eye编码器在六个下游眼科图像分类任务上微调来评估其性能。通过与其他最先进SSL预训练方法比较,成功确立了Uni4Eye的优越性。
引用
@article{arxiv.2203.04614,
title = {Uni4Eye: Unified 2D and 3D Self-supervised Pre-training via Masked Image Modeling Transformer for Ophthalmic Image Classification},
author = {Zhiyuan Cai and Li Lin and Huaqing He and Xiaoying Tang},
journal= {arXiv preprint arXiv:2203.04614},
year = {2022}
}
备注
https://github.com/Davidczy/Uni4Eye