中文

结构即监督:用于放射科学的多视图掩码自编码器

计算机视觉与模式识别 2026-04-03 v4 机器学习

摘要

构建稳健的医疗机器学习系统需要利用临床数据中固有结构的预训练策略。我们引入多视图掩码自编码器(MVMAE),一种自监督框架,利用放射科学研究的天然多视图组织来学习视图不变且与疾病相关的表征。MVMAE将掩码图像重建与跨视图对齐相结合,将临床数据中跨投影的冗余转化为强大的自监督信号。我们进一步提出了MVMAE-V2T,该方法将放射科学报告作为辅助基于文本的学习信号,以增强语义对齐,同时保持完全基于视觉的推断。我们在三个大型公共数据集上评估了下游疾病分类任务,包括MIMIC-CXR、CheXpert和PadChest。MVMAE在受监督和视觉-语言基线模型中 consistently 取得优异成绩。此外,MVMAE-V2T在标签稀缺的情境下提供额外的提升,因而结构化文本监督在此类场景中尤为有益。这些结果共同确立了结构化和文本监督作为通向可扩展、临床导向医学基础模型的重要路径。

关键词

引用

@article{arxiv.2511.22294,
  title  = {Structure is Supervision: Multiview Masked Autoencoders for Radiology},
  author = {Sonia Laguna and Andrea Agostini and Alain Ryser and Samuel Ruiperez-Campillo and Irene Cannistraci and Moritz Vandenhirtz and Stephan Mandt and Nicolas Deperrois and Farhad Nooralahzadeh and Michael Krauthammer and Thomas M. Sutter and Julia E. Vogt},
  journal= {arXiv preprint arXiv:2511.22294},
  year   = {2026}
}