期望最大化作为可扩展医疗智能的引擎
计算机视觉与模式识别
2025-12-09 v2
摘要
大规模、高质量、带标注的数据集是医疗 AI 研究的基础,但构建即使是中等规模的中小型带标注数据集,也需要多学科团队耗费数年精力。尽管主动学习可以优先确定需要标注的内容,但扩大规模仍需大量人工来修正含噪标注。我们将其表述为一个缺失数据问题,并开发了 ScaleMAI,这是一个通过期望最大化(EM)过程将数据标注与模型开发协同演化相统一的框架。在该迭代过程中,AI 模型自动识别并纠正标注中的错误(期望步骤),而精炼后的标注数据则用于重新训练模型以提高准确性(最大化步骤)。除经典 EM 算法外,ScaleMAI 还引入人类专家介入,以审查无法通过期望或最大化步骤充分处理的标注(<5%)。因此,ScaleMAI 逐步创建了一个包含 47,315 次 CT 扫描的带标注数据集(比最大的公共数据集 PanTS 大 4.8 倍),其中包括 4,163,720 个体素级别的良/恶性肿瘤标注和 88 个解剖结构标注。ScaleMAI 迭代训练出的模型在肿瘤诊断上超越了人类专家的表现(+7%),并在两个权威基准测试中,其肿瘤检测(+10%)和分割(+14%)性能均显著优于基于较小、中等质量数据集开发的模型,且具有统计学显著性。
引用
@article{arxiv.2501.03410,
title = {Expectation-Maximization as the Engine of Scalable Medical Intelligence},
author = {Wenxuan Li and Pedro R. A. S. Bassi and Tianyu Lin and Yu-Cheng Chou and Jakob Wasserthal and Xinze Zhou and Qi Chen and Fabian Isensee and Yannick Kirchhoff and Maximilian Rokuss and Saikat Roy and Constantin Ulrich and Klaus Maier-Hein and Szymon Płotka and Xiaoxi Chen and Kang Wang and Yang Yang and Daguang Xu and Kai Ding and Yucheng Tang and Alan L. Yuille and Zongwei Zhou},
journal= {arXiv preprint arXiv:2501.03410},
year = {2025}
}