用混淆因子 Shapley 值分析解释医疗 AI 跨站点性能差异
机器学习
2021-11-17 v1 人工智能
摘要
医疗 AI 算法在先前未见的站点上评估时,常常会出现性能下降。解决跨站点性能差异对于确保 AI 在多样化患者群体部署时的公平与有效至关重要。多站点评估是诊断此类差异的关键,因为它们可以在更广泛的潜在偏倚(如患者人口统计学、设备类型和技术参数)上测试算法。然而,此类测试并不能解释模型为何表现更差。我们的框架提供了一种方法,用于量化当模型在外部数据上评估时,每类偏倚对整体性能差异的边际与累积效应。我们在一个训练用于检测气胸存在的深度学习模型的案例研究中展示了其实用性,其中我们的框架可帮助解释不同站点间高达 60% 的已知偏倚(如疾病共病与成像参数)导致的性能差异。
引用
@article{arxiv.2111.08168,
title = {Explaining medical AI performance disparities across sites with confounder Shapley value analysis},
author = {Eric Wu and Kevin Wu and James Zou},
journal= {arXiv preprint arXiv:2111.08168},
year = {2021}
}
备注
Machine Learning for Health (ML4H) - Extended Abstract