中文

基于变量方阵的分类模型集成及其在药物发现中的应用

机器学习 2015-05-18 v4 统计计算

摘要

在二分类问题中统计检测稀有类对象可能面临若干挑战。由于感兴趣类在训练数据中较为稀有,已知类响应标签中用于模型构建的信息相对较少。同时,可用的解释变量通常具有中等高维特性。在我们的药物发现应用的四项测定中,化合物对特定生物靶点(如肺癌肿瘤细胞)具有活性或非活性,且活性化合物较为稀有。来自计算化学的多组化学描述符变量可用于分类活性与非活性类;每组变量可包含多达数千个表征化合物分子结构的变量。统计挑战在于如何在响应信息稀缺的情况下充分利用解释变量的丰富性。我们的算法自适应地将解释变量划分为子集,并将每个子集传递给基分类器。然后将各种基分类器进行集成,产生一个模型,以便根据新对象属于感兴趣稀有类的估计概率对其进行排序。该算法的精髓在于选择子集,使得同一组内的变量能够协同工作;我们将这样的组称为方阵(phalanxes)。

关键词

引用

@article{arxiv.1303.4805,
  title  = {Ensembling classification models based on phalanxes of variables with applications in drug discovery},
  author = {Jabed H. Tomal and William J. Welch and Ruben H. Zamar},
  journal= {arXiv preprint arXiv:1303.4805},
  year   = {2015}
}

备注

Published at http://dx.doi.org/10.1214/14-AOAS778 in the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)