中文

LIT-PCBA 基准测试中的数据泄露与冗余

机器学习 2025-08-08 v2 定量方法

摘要

LIT-PCBA 被广泛用于虚拟筛选模型的基准测试,但我们的审计揭示其存在根本性缺陷。我们发现其划分中存在广泛的数据泄露和分子冗余,包括划分内部和跨划分的二维相同配体、普遍的类似物重叠以及低多样性的查询集。例如,仅在 ALDH1 中,在 ECFP4 Tanimoto 相似度 0.6\geq 0.6 时,就存在 323 个活跃的训练-验证类似物对;在所有靶标中,有 2,491 个二维非活性分子同时出现在训练集和验证集中,而相应的活性分子却很少。这些重叠使得模型可以通过骨架记忆而非泛化来取得成功,从而虚增了富集因子和 AUROC 分数。这些缺陷并非偶然——它们如此严重,以至于一个基于记忆的、无可学习参数的平凡基线可以利用它们来匹配或超越最先进的深度学习和三维相似性模型所报告的性能。因此,几乎所有已发表的关于 LIT-PCBA 的结果都受到了损害。即使在“零样本”模式下评估的模型也会受到查询集中类似物泄露的影响,从而削弱了关于泛化能力的论断。以其当前形式,该基准测试并不能衡量模型恢复新型化学类型的能力,不应被视为方法论进展的证据。所有代码、数据和基线实现均可在以下网址获取:https://github.com/sievestack/LIT-PCBA-audit

关键词

引用

@article{arxiv.2507.21404,
  title  = {Data Leakage and Redundancy in the LIT-PCBA Benchmark},
  author = {Amber Huang and Ian Scott Knight and Slava Naprienko},
  journal= {arXiv preprint arXiv:2507.21404},
  year   = {2025}
}