中文

ViT-AE++:改进视觉 Transformer 自编码器以用于自监督医学图像表示

计算机视觉与模式识别 2023-05-17 v2

摘要

自监督学习因能从无标注数据中学习数据驱动的表示而受到越来越多的关注。He 等人(2021)提出的基于视觉 Transformer 的自编码器(ViT-AE)是一种近期的自监督学习技术,其采用块掩码策略来学习有意义的潜在空间。本文致力于改进 ViT-AE(昵称为 ViT-AE++),以更有效地表示 2D 和 3D 医学图像。我们提出两种新的损失函数以增强训练过程中的表示。第一项损失通过考虑结构化依赖关系来改善自重建,并间接改进表示。第二项损失利用对比损失直接从两个随机掩码视图优化表示。作为独立贡献,我们将 ViT-AE++ 扩展到 3D 形式以处理体医学图像。我们在自然图像和医学图像上广泛评估了 ViT-AE++,证明其在 vanilla ViT-AE 上的持续改进以及相对于其他对比学习方法的优越性。代码见:https://github.com/chinmay5/vit_ae_plus_plus.git。

关键词

引用

@article{arxiv.2301.07382,
  title  = {ViT-AE++: Improving Vision Transformer Autoencoder for Self-supervised Medical Image Representations},
  author = {Chinmay Prabhakar and Hongwei Bran Li and Jiancheng Yang and Suprosana Shit and Benedikt Wiestler and Bjoern Menze},
  journal= {arXiv preprint arXiv:2301.07382},
  year   = {2023}
}

备注

Accepted in MIDL 2023. C. Prabhakar and H. B. Li contribute equally. Codes here: https://github.com/chinmay5/vit_ae_plus_plus.git