中文

揭示蛋白质相互作用基准测试中的数据泄露问题

机器学习 2024-04-17 v1

摘要

近年来,用于蛋白质-蛋白质相互作用的机器学习取得了显著进展。然而,先前的工作主要集中于改进学习算法,而对评估策略和数据准备关注较少。在此,我们证明机器学习方法的进一步发展可能会受到现有训练-测试集划分质量的阻碍。具体而言,我们发现基于蛋白质序列或元数据相似性的常用蛋白质复合物划分策略会引入严重的数据泄露。这可能导致对泛化能力的过度乐观评估,以及对模型的不公平基准测试,使其偏向于评估过拟合能力而非实际效用。为了克服数据泄露问题,我们建议基于蛋白质-蛋白质界面的三维结构相似性来构建数据划分,并提出了相应的算法。我们相信,解决数据泄露问题对于该研究领域的进一步发展至关重要。

关键词

引用

@article{arxiv.2404.10457,
  title  = {Revealing data leakage in protein interaction benchmarks},
  author = {Anton Bushuiev and Roman Bushuiev and Jiri Sedlar and Tomas Pluskal and Jiri Damborsky and Stanislav Mazurenko and Josef Sivic},
  journal= {arXiv preprint arXiv:2404.10457},
  year   = {2024}
}