中文

ViT-DAE:用于组织病理学图像分析的Transformer驱动扩散自编码器

计算机视觉与模式识别 2023-04-04 v1

摘要

生成式AI近年来受到广泛关注,因其能够合成与原始数据源高度相似的数据。尽管生成对抗网络(GAN)为组织病理学图像分析提供了创新方法,但它们存在模式崩溃和判别器过拟合等局限。近来,去噪扩散模型在计算机视觉中展现出有前景的结果。这些模型在训练时表现出更优的稳定性、更好的分布覆盖能力,并能生成高质量且多样化的图像。此外,它们对噪声和扰动表现出高度的鲁棒性,非常适用于数字病理学——该领域图像通常含有伪影且染色差异显著。本文提出一种新方法,即ViT-DAE,它将视觉Transformer(ViT)与扩散自编码器相结合,用于高质量组织病理学图像合成。这是计算病理学中首次将ViT引入扩散自编码器,使模型能更好地捕捉组织病理学图像中复杂而精细的细节。我们在三个公开数据集上验证了ViT-DAE的有效性。该方法在生成逼真图像方面优于近期基于GAN的方法和原始DAE方法。

关键词

引用

@article{arxiv.2304.01053,
  title  = {ViT-DAE: Transformer-driven Diffusion Autoencoder for Histopathology Image Analysis},
  author = {Xuan Xu and Saarthak Kapse and Rajarsi Gupta and Prateek Prasanna},
  journal= {arXiv preprint arXiv:2304.01053},
  year   = {2023}
}

备注

Submitted to MICCAI 2023