医疗保健机器学习中的样本选择偏差
机器学习
2025-08-21 v3
摘要
尽管机器学习算法在个性化医疗方面具有广阔前景,但其临床应用仍然有限,部分原因在于偏差可能会损害预测的可靠性。在本文中,我们关注样本选择偏差 (SSB),这是一种特定类型的偏差,其中研究人群对目标人群的代表性不足,从而导致有偏差且可能有害的决策。尽管 SSB 在文献中广为人知,但在医疗保健机器学习中却鲜有研究。此外,现有的机器学习技术主要试图通过平衡研究人群和目标人群之间的分布来纠正偏差,这可能导致预测性能的损失。为了解决这些问题,我们的研究通过考察 SSB 对机器学习算法性能的影响,说明了与 SSB 相关的潜在风险。最重要的是,我们提出了解决 SSB 的新研究方向,该方向基于目标人群识别而非偏差纠正。具体而言,我们提出了两个独立的网络 (T-Net) 和一个多任务网络 (MT-Net) 来解决 SSB,其中一个网络/任务识别对研究人群具有代表性的目标子人群,第二个网络/任务对所识别的子人群进行预测。我们使用合成和半合成数据集的实证结果强调,与研究人群相比,SSB 会导致算法在目标人群上的性能大幅下降,并且在代表研究人群中被选中和未被选中患者的目标子人群上存在显著性能差异。此外,我们提出的技术在各种设置下表现出稳健性,包括不同的数据集大小、事件率和选择率,优于现有的偏差纠正技术。
引用
@article{arxiv.2405.07841,
title = {Sample Selection Bias in Machine Learning for Healthcare},
author = {Vinod Kumar Chauhan and Lei Clifton and Achille Salaün and Huiqi Yvonne Lu and Kim Branson and Patrick Schwab and Gaurav Nigam and David A. Clifton},
journal= {arXiv preprint arXiv:2405.07841},
year = {2025}
}
备注
Accepted to ACM Transactions on Computing for Healthcare (21 pages and 11 figures)