中文

使用自整定重加权采样方法选择重要分子描述子用于抗结核活性预测

机器学习 2014-02-24 v1 应用统计 机器学习

摘要

本文提出了一种新的描述子选择方法,用于选择磺胺衍生物数据中重要描述子的最优组合,称为自整定重加权采样(STRS)。重要描述子定义为在偏最小二乘(PLS)等多变量线性回归模型中具有较大绝对系数的描述子。本研究将PLS模型回归系数的绝对值作为评估每个描述子重要性的指标。然后,基于每个描述子的重要性水平,STRS以迭代和竞争的方式从N次蒙特卡洛(MC)采样运行中依次选择N个描述子子集。在每次采样运行中,首先随机选取固定比例(如80%)的样本来建立回归模型。接下来,基于回归系数,采用两步程序选择重要描述子,包括基于快速下降函数(RDF)的强制描述子选择和基于自整定采样(STS)的竞争描述子选择。循环运行后,获得若干描述子子集,并计算用这些描述子子集建立的PLS模型的交叉验证均方根误差(RMSECV)。具有最低RMSECV的描述子子集被视为最优描述子子集。通过磺胺衍生物数据集评估了所提算法的性能。结果表明STRS具有良好的特性,通常能够定位一些重要描述子的最优组合,这些描述子对感兴趣的生物学特性具有可解释性。此外,我们的研究表明,与全描述子集PLS建模和蒙特卡洛无信息变量消除(MC-UVE)相比,STRS获得了更好的预测效果。

关键词

引用

@article{arxiv.1402.5360,
  title  = {Important Molecular Descriptors Selection Using Self Tuned Reweighted Sampling Method for Prediction of Antituberculosis Activity},
  author = {Doreswamy and Chanabasayya M. Vastrad},
  journal= {arXiv preprint arXiv:1402.5360},
  year   = {2014}
}

备注

published 2013