中文

命中富集曲线的推断及其在药物发现中的应用

应用统计 2021-09-24 v3 信息检索 机器学习 定量方法 统计方法学

摘要

在药物发现的虚拟筛选中,命中富集曲线被广泛用于评估排序算法在识别早期富集方面的性能。遗憾的是,研究者在宣称竞争算法性能存在差异之前,几乎从不考虑估计此类曲线的不确定性。恰当的推断因两个常被忽视的相关性来源而复杂化:单一算法内不同测试比例间的相关性,以及竞争算法之间的相关性。此外,研究者通常关注沿整条曲线进行比较,而不仅在少数测试比例处。我们开发了推断流程,以满足关注少数测试比例者以及关注整条曲线者的需求。对前者,考察了四种假设检验与(逐点)置信区间,发现新近开发的 EmProc 方法最为有效。对整条曲线的推断,推荐采用基于 EmProc 的置信带以实现同时覆盖与最小宽度。我们的推断流程也可轻易推广至富集因子。

关键词

引用

@article{arxiv.1912.09526,
  title  = {Inference for Hit Enrichment Curves, with Applications to Drug Discovery},
  author = {Jeremy R. Ash and Jacqueline M. Hughes-Oliver},
  journal= {arXiv preprint arXiv:1912.09526},
  year   = {2021}
}

备注

34 pages, 6 figures, 2 tables. Original version was a chapter in Jeremy Ash's dissertation. Current version is the paper submitted to Journal of American Statistical Association: Applications and Case Studies