中文

面向精准医疗中代表性不足人群的联邦迁移学习方法

机器学习 2021-08-30 v1 计算机与社会 机器学习

摘要

少数族裔和弱势人群在大规模临床与基因组学研究中的代表性有限,已成为将精准医疗研究转化为实践的障碍。由于人群间的异质性,风险预测模型在这些代表性不足人群中常表现不佳,从而可能进一步加剧已知的健康不平等。本文提出一种双向数据整合策略,通过联邦迁移学习方法整合来自不同人群和多家医疗机构的异质数据。所提方法能够处理来自不同人群的样本量高度不平衡这一挑战性设定。仅需参与方之间少量的通信,该方法即可达到与将个体层面数据直接汇总的合并分析相当的性能。我们表明,所提方法提高了代表性不足人群中的估计与预测精度,并缩小了人群间模型性能的差距。我们的理论分析揭示了估计精度如何受通信预算、隐私限制以及人群间异质性的影响。我们通过数值实验和一项多中心研究的真实应用验证了方法的可行性与有效性,其中我们构建了针对非裔美国人(AA)人群中 II 型糖尿病的多基因风险预测模型。

关键词

引用

@article{arxiv.2108.12112,
  title  = {Targeting Underrepresented Populations in Precision Medicine: A Federated Transfer Learning Approach},
  author = {Sai Li and Tianxi Cai and Rui Duan},
  journal= {arXiv preprint arXiv:2108.12112},
  year   = {2021}
}