中文

MedVAE:基于大规模通用自编码器的医学图像高效自动解释

图像与视频处理 2025-06-04 v2 人工智能 计算机视觉与模式识别

摘要

医学图像以高分辨率和大视野获取,以捕获临床决策所需的细粒度特征。因此,在医学图像上训练深度学习模型会产生较大的计算成本。本文旨在压缩医学图像,以提高下游计算效率,同时保留临床相关特征。我们引入MedVAE,一组六个大规模2D和3D自编码器,能够将医学图像编码为压缩后的潜在表示,并将潜在表示解码回高分辨率图像。我们采用新颖的两阶段训练方法,使用1,052,730张医学图像进行训练。在来自20个医学图像数据集的多样化任务中,我们展示:(1)在训练下游模型时使用MedVAE的潜在表示而非高分辨率图像,可实现效率优势(吞吐量提升最高可达70倍),同时保持临床相关特征;(2)MedVAE能够以高保真度将潜在表示解码回高分辨率图像。我们的工作表明,大规模通用自编码器有助于解决医疗领域的关键性效率挑战。我们的代码已在https://github.com/StanfordMIMI/MedVAE上提供。

关键词

引用

@article{arxiv.2502.14753,
  title  = {MedVAE: Efficient Automated Interpretation of Medical Images with Large-Scale Generalizable Autoencoders},
  author = {Maya Varma and Ashwin Kumar and Rogier van der Sluijs and Sophie Ostmeier and Louis Blankemeier and Pierre Chambon and Christian Bluethgen and Jip Prince and Curtis Langlotz and Akshay Chaudhari},
  journal= {arXiv preprint arXiv:2502.14753},
  year   = {2025}
}

备注

MIDL 2025 (Oral)