多重生物标志物分类器的评估:基本原理与一种策略提议
基因组学
2019-11-01 v1 机器学习
应用统计
摘要
本文基于统计模式识别、机器学习或近期所谓“数据科学”领域的一些基本原理,综述了多重生物标志物分类器问题及其评估。对该文献的狭隘解读致使许多作者忽视了有限训练样本对性能评估总不确定性的贡献。然而后者是分类器稳定性的基本指标;因此其忽视可能正导致许多研究陷入问题重重的境地。我们提出了在该领域推进的三级策略。最低层为构建层,在此筛选候选特征并确定分类器架构选择。此时估计分类器的有效维数,并用以确定下一层分析(针对未见病例的初步研究)的规模。初步研究产生的总(训练与测试)不确定性进而用于确定最高层分析(具目标不确定性水平的 pivotal study)的规模。我们综述了文献中可用于实施该方法的若干资源。尽管本文阐述的概念对机器学习界许多研究者而言可能基本且直白,但对许多从业者却颇为微妙;我们在 \cite{Shi2010MAQCII} 中给出了最佳实践的一般性建议,并在此文中详述。
引用
@article{arxiv.1910.14502,
title = {Assessment of Multiple-Biomarker Classifiers: fundamental principles and a proposed strategy},
author = {Waleed A. Yousef},
journal= {arXiv preprint arXiv:1910.14502},
year = {2019}
}