中文

基于SPL-Logsum的 molecular structure 生物活性 QSAR 分类建模

机器学习 2018-05-01 v2 机器学习

摘要

定量构效关系(QSAR)建模是探寻分子结构生物活性可靠关联的有效“桥梁”。QSAR分类模型包含大量冗余、含噪及不相关的描述符。为此,已有多种描述符选择方法被提出,一般可分为过滤式、包裹式和嵌入式三类。正则化方法是一种重要的嵌入式技术,可用于连续收缩与自动描述符选择。近年来,研究者在描述符选择中应用正则化技术(如带 L1L_1 惩罚的逻辑回归(LR))的兴趣日益增长。本文提出一种基于自步学习(SPL)与 Logsum 惩罚 LR 的新型描述符选择方法,用于预测分子结构的生物活性。SPL 受人与动物从易样本(较小损失)到难样本(较大损失)渐进学习过程的启发,而 Logsum 正则化则能遴选出少数有意义且显著的分子描述符。在仿真与三个公开 QSAR 数据集上的实验表明,所提 SPL-Logsum 方法在分类性能与模型可解释性上优于其他常用稀疏方法。

关键词

引用

@article{arxiv.1804.08615,
  title  = {QSAR Classification Modeling for Bioactivity of Molecular Structure via SPL-Logsum},
  author = {Liang-Yong Xia and Qing-Yong Wang},
  journal= {arXiv preprint arXiv:1804.08615},
  year   = {2018}
}