防止数据集偏移破坏机器学习生物标志物
机器学习
2021-07-22 v1 统计理论
定量方法
统计理论
摘要
机器学习带来了从具有丰富生物医学测量的队列中提取新生物标志物的希望。一个好的生物标志物能够可靠地检测相应状况。然而,生物标志物通常提取自与目标人群不同的队列。这种不匹配被称为数据集偏移(dataset shift),会削弱该生物标志物对新个体的应用。数据集偏移在生物医学研究中十分常见,例如由于招募偏倚。当发生数据集偏移时,标准机器学习技术不足以提取和验证生物标志物。本文概述了数据集偏移在何时以及如何破坏机器学习提取的生物标志物,以及检测与校正策略。
引用
@article{arxiv.2107.09947,
title = {Preventing dataset shift from breaking machine-learning biomarkers},
author = {Jéroôme Dockès and Gaël Varoquaux and Jean-Baptiste Poline},
journal= {arXiv preprint arXiv:2107.09947},
year = {2021}
}
备注
GigaScience, BioMed Central, In press