大多数基于配体的分类基准奖励记忆而非泛化
定量方法
2018-05-11 v2 机器学习
机器学习
摘要
当训练数据与验证数据之间存在显著冗余时,可能发生未被检测到的过拟合。我们描述了AVE,一种针对基于配体的分类问题的训练-验证冗余新度量,该度量同时考虑了非活性分子与活性分子之间的相似性。我们研究了七个广泛使用的虚拟筛选与分类基准,并表明AVE偏差的大小与基于配体的预测方法的性能强相关,无论预测的性质、化学指纹、相似性度量或先前应用的去偏技术如何。因此,大多数基于配体的方法先前报告的性能可能可以用对基准的过拟合而非良好的前瞻性准确率来解释。
引用
@article{arxiv.1706.06619,
title = {Most Ligand-Based Classification Benchmarks Reward Memorization Rather than Generalization},
author = {Izhar Wallach and Abraham Heifets},
journal= {arXiv preprint arXiv:1706.06619},
year = {2018}
}