命中富集曲线的推断及其在药物发现中的应用
应用统计
2021-09-24 v3 信息检索
机器学习
定量方法
统计方法学
摘要
在药物发现的虚拟筛选中,命中富集曲线被广泛用于评估排序算法在识别早期富集方面的性能。遗憾的是,研究者在宣称竞争算法性能存在差异之前,几乎从不考虑估计此类曲线的不确定性。恰当的推断因两个常被忽视的相关性来源而复杂化:单一算法内不同测试比例间的相关性,以及竞争算法之间的相关性。此外,研究者通常关注沿整条曲线进行比较,而不仅在少数测试比例处。我们开发了推断流程,以满足关注少数测试比例者以及关注整条曲线者的需求。对前者,考察了四种假设检验与(逐点)置信区间,发现新近开发的 EmProc 方法最为有效。对整条曲线的推断,推荐采用基于 EmProc 的置信带以实现同时覆盖与最小宽度。我们的推断流程也可轻易推广至富集因子。
引用
@article{arxiv.1912.09526,
title = {Inference for Hit Enrichment Curves, with Applications to Drug Discovery},
author = {Jeremy R. Ash and Jacqueline M. Hughes-Oliver},
journal= {arXiv preprint arXiv:1912.09526},
year = {2021}
}
备注
34 pages, 6 figures, 2 tables. Original version was a chapter in Jeremy Ash's dissertation. Current version is the paper submitted to Journal of American Statistical Association: Applications and Case Studies