机器学习模型中的偏差可通过精心训练显著缓解:来自神经影像研究的证据
机器学习
2023-02-01 v2 图像与视频处理
摘要
尽管机器学习在许多医学领域展现出巨大前景,但也引发了人们对跨性别、年龄分布、种族与民族、医院以及数据采集设备与协议等方面潜在偏差和泛化不佳的担忧。在本研究中,我们针对三种脑部疾病提供证据表明,经过适当训练的机器学习模型能够在多样化条件下良好泛化,且未必存在偏差。具体而言,通过使用多研究磁共振成像联盟来诊断阿尔茨海默病、精神分裂症和自闭症谱系障碍,我们发现训练良好的模型在不同子群体(涉及性别、年龄、种族群体以及不同临床研究等属性)上的曲线下面积(AUC)较高,并且在人口均等差、均等几率差、均等机会差等多种公平性指标下无偏。我们发现,融合人口统计学、临床、遗传因素和认知评分等多源数据的模型同样无偏。这些模型在各子群体上的预测 AUC 优于仅使用影像特征训练的模型,但也存在这些额外特征无济于事的情况。
引用
@article{arxiv.2205.13421,
title = {Bias in Machine Learning Models Can Be Significantly Mitigated by Careful Training: Evidence from Neuroimaging Studies},
author = {Rongguang Wang and Pratik Chaudhari and Christos Davatzikos},
journal= {arXiv preprint arXiv:2205.13421},
year = {2023}
}