中文

基于含噪声部分标记数据集的蛋白质-蛋白质相互作用预测器评估

人工智能 2015-09-21 v1 机器学习

摘要

蛋白质-蛋白质相互作用(PPI)预测是机器学习和计算生物学中的一个重要问题。然而,没有用于训练或评估目的的数据集,其中所有实例都被准确标记。相反,可用的是正类实例(可能带有噪声标签)而没有负类实例。负类数据的不可用通常通过以下观察处理:随机选择的蛋白质对几乎100%的概率为负类,因为预计每1,500个蛋白质对中只有1个预期为相互作用对。在本文中,我们关注蛋白质-蛋白质相互作用(PPI)预测领域中准确标记的测试数据集的不可用可能导致有偏评估结果的问题。我们首先表明,不承认相互作用组中的固有偏斜(即正实例的罕见出现)导致预测器的准确度被高估。然后我们表明,基于正相互作用是稀有类别的信念,采样排除已知相互作用蛋白质集的随机蛋白质对作为负测试数据集可能导致评估结果被低估。我们形式化了这两个问题以验证上述主张,并基于该形式化,我们提出了一种平衡方法,以用低估抵消高估。最后,我们的实验验证了理论方面,并表明这种平衡评估可以在没有黄金标准数据集可用的情况下评估确切性能。

关键词

引用

@article{arxiv.1509.05742,
  title  = {Evaluation of Protein-protein Interaction Predictors with Noisy Partially Labeled Data Sets},
  author = {Haohan Wang and Madhavi K. Ganapathiraju},
  journal= {arXiv preprint arXiv:1509.05742},
  year   = {2015}
}

备注

preprint version, 9 pages, 7 figures