中文

化学中的聪明汉子:化学家风格信号混淆公共基准上的活性预测

生物大分子 2025-12-25 v1 机器学习 化学物理

摘要

机器学习模型能否仅从分子结构识别出是哪位化学家制作的分子?如果是这样,那么在文献数据上训练的模型可能利用化学家的意图,而非学习因果结构-活性关系。在我们测试了将 CHEMBL 实验与出版物作者关联联合后训练一个 1815 类的分类器来从分子指纹预测作者时,实现了 60% 的 Top-5 准确率(基于骨架划分)。随后,我们训练了一个仅接收蛋白质标识符和来源于结构的作者概率向量的活性模型,该模型未直接访问分子描述符。这个仅依赖作者的模型在预测能力上相当于一个简单基线——后者可直接访问结构信息。这揭示了一种“聪明汉子”失效模式:模型可 largely 通过推断化学家目标和偏好靶点来预测生物活性,而无需对化学有一个独立于实验室的理解。我们分析了这种数据泄露的来源,提出作者无交叉划分方案,并就脱离化学家意图与生物结果之间的关系建议数据集实践。

关键词

引用

@article{arxiv.2512.20924,
  title  = {Clever Hans in Chemistry: Chemist Style Signals Confound Activity Prediction on Public Benchmarks},
  author = {Andrew D. Blevins and Ian K. Quigley},
  journal= {arXiv preprint arXiv:2512.20924},
  year   = {2025}
}