中文

潜在扩散自编码器:医学影像高效且有意义的无监督表征学习

计算机视觉与模式识别 2026-01-12 v1

摘要

本研究提出了潜在扩散自编码器(Latent Diffusion Autoencoder, LDAE),这是一种新颖的编码器-解码器扩散框架,用于医学影像的高效且有意义的无监督学习。以阿尔茨海默病(Alzheimer's disease, AD)为案例研究,采用来自 ADNI 数据库的脑部 MRI 图像。不同于传统的在图像空间中进行扩散的自编码器,LDAE 在压缩后的潜在表征中应用扩散过程,从而提高了计算效率,使三维医学影像表征学习变得可行。为验证所提出的方法,本文探讨了两个关键假设:(i) LDAE 在与 AD 及年衰老相关的三维脑部 MRI 中有效捕获有意义的语义表征;(ii) LDAE 实现高质量的图像生成与重构,同时计算效率高。实验结果支持这两个假设:(i) 线性探针评估显示,LDAE 对 AD(ROC-AUC: 90%, ACC: 84%)和年龄预测(MAE: 4.1 年, RMSE: 5.2 年)表现优异;(ii) 学习到的语义表征可实现属性操控,生成解剖学上合理的修改;(iii) 语义插值实验表明,模型能够强力重建缺失检查扫描,在 6 个月间隔处 SSIM 为 0.969(MSE: 0.0019);(iv) 对于更长的间隔(24 个月),模型仍保持稳健性能(SSIM > 0.93, MSE < 0.004),表明其能够捕捉时间进程趋势;(v) 与传统扩散自编码器相比,LDAE 推理吞吐量提高了 20 倍,同时提升了重构质量。这些发现将 LDAE 定位为医学影像可扩展应用的有前景框架,潜力可作为医学图像分析的基础模型。代码地址:https://github.com/GabrieleLozupone/LDAE

关键词

引用

@article{arxiv.2504.08635,
  title  = {Latent Diffusion Autoencoders: Toward Efficient and Meaningful Unsupervised Representation Learning in Medical Imaging},
  author = {Gabriele Lozupone and Alessandro Bria and Francesco Fontanella and Frederick J. A. Meijer and Claudio De Stefano and Henkjan Huisman},
  journal= {arXiv preprint arXiv:2504.08635},
  year   = {2026}
}

备注

15 pages, 9 figures, 7 tables