中文

诊断理化性质预测中的异方差性并解决多重共线性悖论

机器学习 2026-03-20 v2 化学物理 生物大分子 应用统计

摘要

亲脂性(logP)预测仍是药物发现的核心,然而用于此任务的线性回归模型经常违反统计假设,使其报告的性能指标失效。我们分析了来自 PubChem、ChEMBL 和 eMolecules 数据库严格筛选交集得到的 426,850 个生物活性分子,揭示了预测计算 logP 值(XLOGP3)的线性模型中存在严重的异方差性:与平衡区域(logP 2 至 4)相比,亲脂性区域(logP 大于 5)的残差方差增加了 4.2 倍。经典的补救策略(加权最小二乘法和 Box-Cox 变换)未能解决这一违反假设的问题(所有变体的 Breusch-Pagan p 值均小于 0.0001)。基于树的集成方法(随机森林 R² 为 0.764,XGBoost R² 为 0.765)被证明对异方差具有固有的鲁棒性,同时提供了更优的预测性能。SHAP 分析解决了一个关键的多重共线性悖论:尽管分子量与 logP 的双变量相关性较弱(0.146),但它却成为最重要的单一预测因子(平均绝对 SHAP 值为 0.573),其效应在简单相关性分析中被与拓扑极性表面积(TPSA)的混杂所抑制。这些发现表明,标准线性模型在计算亲脂性预测中面临根本性挑战,并为在 QSAR 应用中解释集成模型提供了一个原则性框架。

关键词

引用

@article{arxiv.2512.24643,
  title  = {Diagnosing Heteroskedasticity and Resolving Multicollinearity Paradoxes in Physicochemical Property Prediction},
  author = {Malikussaid and Septian Caesar Floresko and Ade Romadhony and Isman Kurniawan and Warih Maharani and Hilal Hudan Nuha},
  journal= {arXiv preprint arXiv:2512.24643},
  year   = {2026}
}

备注

7 pages, 4 figures, 3 tables, to be published in KST 2026, unabridged version exists as arXiv:2512.24643v1