中文

利用归因方法解码化学神经网络模型中的数据集偏差

机器学习 2020-02-12 v3 机器学习

摘要

深度神经网络在分类分子是否结合特定蛋白质靶标方面已达到最优准确率。如果这些模型能揭示在结合中起因果作用的片段药效团,将是一个关键突破。从网络中提取结合的化细节有可能带来关于药物作用机制的科学发现。但这样做需要照亮训练好的神经网络模型这一黑箱,这项任务在许多领域都被证明十分困难。本文展示了如何利用最近描述的归因方法,来审问深度神经网络模型所学到的结合机制。我们首先使用精心构建的合成数据集,其中结合的“片段逻辑”完全已知。我们发现,在留出测试集上达到完美准确率的网络仍会因数据集中的偏差而学到虚假关联,并且我们能利用这种非鲁棒性构造欺骗模型的对抗样本。数据集偏差使得这些模型在准确揭示蛋白-配体结合机制信息方面不可靠。鉴于我们的发现,我们提出一种在给定假设下检查数据集偏差的检验。若检验失败,表明要么必须简化或正则化模型,要么需要扩充训练数据集。

关键词

引用

@article{arxiv.1811.11310,
  title  = {Using Attribution to Decode Dataset Bias in Neural Network Models for Chemistry},
  author = {Kevin McCloskey and Ankur Taly and Federico Monti and Michael P. Brenner and Lucy Colwell},
  journal= {arXiv preprint arXiv:1811.11310},
  year   = {2020}
}