面向生物医学二分类的严谨机器学习分析流程:在胰腺癌嵌套病例对照研究中的应用及对偏倚评估的启示
机器学习
2020-09-10 v2 机器学习
摘要
机器学习(ML)提供了一系列强大的方法来检测和建模关联,常应用于具有大量特征和/或复杂关联的数据。目前,有许多工具可便于实现定制的ML分析(例如 scikit-learn)。对自动化ML软件包的兴趣也在增加,它们可使非专家更容易应用ML,并有可能改善模型性能。ML以不同程度的严谨性和正确性渗透到生物医学研究的大多数子领域。ML带来的巨大机遇常被组装综合分析流程的挑战以及ML易被误用所抵消。在这项工作中,我们制定并组装了一个完整、严谨的专注于二分类(即病例/对照预测)的ML分析流程,并将该流程应用于模拟和真实世界数据。在高层次上,这个“自动化”但可定制的流程包括 a) 探索性分析,b) 数据清洗与转换,c) 特征选择,d) 使用9种既定ML算法进行模型训练(每种均含超参数优化),以及 e) 全面评估(包括适当的指标、统计分析和新颖的可视化)。该流程组织了ML流程组装中的许多微妙复杂性,以说明避免偏倚和确保可重复性的最佳实践。此外,该流程首次将既定ML算法与“ExSTraCS”进行比较,ExSTraCS是一种基于规则的ML算法,具有可解释地建模异质关联模式的独特能力。虽然设计用于广泛适用,我们将该流程应用于一项针对胰腺癌既定和新确定风险因素的流行病学调查,以评估ML算法如何处理不同来源的偏倚。
引用
@article{arxiv.2008.12829,
title = {A Rigorous Machine Learning Analysis Pipeline for Biomedical Binary Classification: Application in Pancreatic Cancer Nested Case-control Studies with Implications for Bias Assessments},
author = {Ryan J. Urbanowicz and Pranshu Suri and Yuhan Cui and Jason H. Moore and Karen Ruth and Rachael Stolzenberg-Solomon and Shannon M. Lynch},
journal= {arXiv preprint arXiv:2008.12829},
year = {2020}
}
备注
22 pages, 12 figures