利用少量数据使机器学习诊断模型适应新人群:来自临床神经科学的发现
机器学习
2024-09-16 v2 图像与视频处理
定量方法
摘要
机器学习(ML)在包括医疗健康在内的多个领域展现出巨大变革潜力。然而,它也面临可重复性危机,尤其在医学中。在训练集上精心构建并评估的ML模型,可能难以很好地泛化到来自不同患者人群或采集仪器设置与协议的数据上。我们在阿尔茨海默病(AD)、精神分裂症(SZ)和脑衰老的神经影像背景下解决此问题。我们开发了一种加权经验风险最小化方法,该方法最优地结合来自源组的数据(例如,按性别、年龄组、种族和临床队列等属性对受试者进行分层),以对目标组(例如,其他性别、年龄组等)进行预测,仅使用来自目标组的少量(10%)数据。我们将此方法应用于来自20项神经影像研究的15,363名个体的多源数据,构建用于AD和SZ诊断以及脑年龄估计的ML模型。我们发现该方法比现有域适应技术取得显著更好的准确性:它在所有目标组上获得AD分类曲线下面积大于0.95、SZ分类曲线下面积大于0.7、脑年龄预测平均绝对误差小于5年,实现了对扫描仪、协议以及人口统计学或临床特征变化的鲁棒性。在某些情况下,它甚至优于在目标组所有数据上训练,因为它利用了更大训练集的多样性和规模。我们还展示了我们的模型在预后任务中的效用,例如预测轻度认知障碍个体的疾病进展。关键的是,我们的脑年龄预测模型带来了关于与神经生理学测试相关性的新临床见解。
引用
@article{arxiv.2308.03175,
title = {Adapting Machine Learning Diagnostic Models to New Populations Using a Small Amount of Data: Results from Clinical Neuroscience},
author = {Rongguang Wang and Guray Erus and Pratik Chaudhari and Christos Davatzikos},
journal= {arXiv preprint arXiv:2308.03175},
year = {2024}
}