超越独立帧:基于潜在注意力掩码自编码器的多视角心尿动图
计算机视觉与模式识别
2026-04-17 v1 机器学习
摘要
心尿动图因其无创和高性价比,成为心脏评估的常用模态,但稀疏且异质的心脏时空视角带来了独特挑战。现有掩码自编码器 (MAE) 方法通常独立处理图像或短片段,无法捕捉心脏表征所需的内在多视角结构。我们提出潜在注意力掩码自编码器 (LAMAE),为医学成像的多视角特性量身打造的基础模型架构。LAMAE 在标准 MAE 基础上加入潜在注意力模块,使其能在潜在空间直接实现跨帧和跨视角的信息交换。这使模型能够聚合可变长度序列和不同视角,重建来自部分观察的心脏功能整体表征。我们在 MIMIC-IV-ECHO 大规模、未经整理的数据集上进行预训练。据我们所知,这是首次在 MIMIC-IV-ECHO 视频上预测 ICD-10 编码的研究结果。此外,我们实证表明,来自成人数据的学习表示可有效迁移至儿童队列,尽管存在显著的解剖差异。这些结果表明,纳入结构性偏差(如多视角注意力)可显著提升表示的鲁棒性和可迁移性。
引用
@article{arxiv.2604.15096,
title = {Beyond Independent Frames: Latent Attention Masked Autoencoders for Multi-View Echocardiography},
author = {Simon Böhi and Irene Cannistraci and Sergio Muñoz Gonzalez and Moritz Vandenhirtz and Sonia Laguna and Samuel Ruiperez-Campillo and Max Krähenmann and Andrea Agostini and Ece Ozkan and Thomas M. Sutter and Julia E. Vogt},
journal= {arXiv preprint arXiv:2604.15096},
year = {2026}
}
备注
Accepted as a workshop paper at the ICLR 2026 Workshop on Foundation Models for Science