中文

基于时序自注意力机制的 MAE 长纵向医学图像预训练

机器学习 2025-12-30 v1 计算机视觉与模式识别

摘要

时序感知的图像表示对于捕捉 3D 体积中纵向医学数据集中疾病进展至关重要。然而,最近的自监督学习方法,如掩码自编码器 (MAE),尽管具有强大的表示学习能力,但缺乏时序 awareness。在本文中,我们提出 STAMP(Stochastic Temporal Autoencoder with Masked Pretraining),这是一种通过对输入两个体积之间的时间差进行条件化来编码时序信息的 Siamese MAE 框架。与确定性 Siamese 方法不同,后者仅比较来自不同时间点的扫描,却未能考虑疾病演变内在不确定性;STAMP 通过将 MAE 重建损失重新框定为条件变分推断目标,从而以随机方式学习时序动力学。我们在两个 OCT 数据集和一个 MRI 数据集上评估了 STAMP,每个患者都有多个访问。实验表明,STAMP 预训练的 ViT 模型在不同阶段的年龄相关性黄斑变性和阿尔茨海默病进展预测中,均优于现有的时序 MAE 方法和基础模型,这些任务需要模型学习疾病内在非确定性时序动力学。

关键词

引用

@article{arxiv.2512.23441,
  title  = {Stochastic Siamese MAE Pretraining for Longitudinal Medical Images},
  author = {Taha Emre and Arunava Chakravarty and Thomas Pinetz and Dmitrii Lachinov and Martin J. Menten and Hendrik Scholl and Sobha Sivaprasad and Daniel Rueckert and Andrew Lotery and Stefan Sacu and Ursula Schmidt-Erfurth and Hrvoje Bogunović},
  journal= {arXiv preprint arXiv:2512.23441},
  year   = {2025}
}

备注

Under review. Code is available in https://github.com/EmreTaha/STAMP