中文

基于远程监督与置信度校准BioBERT的大规模蛋白质-蛋白质翻译后修饰抽取

机器学习 2022-01-10 v1 计算与语言

摘要

蛋白质-蛋白质相互作用(PPIs)对正常细胞功能至关重要,并与许多疾病通路相关。然而,在IntAct等生物知识数据库中仅4%的PPI被标注了PTM,且主要通过人工整理完成,既不省时也不经济。我们利用IntAct PPI数据库创建了一个远程监督数据集,标注了相互作用的蛋白质对、其对应PTM类型以及来自PubMed数据库的关联摘要。我们训练了一组BioBERT模型集成——称为PPI-BioBERT-x10,以改善置信度校准。我们将集成平均置信度方法与置信度变异相结合,以抵消类不平衡的影响,从而抽取高置信度预测。PPI-BioBERT-x10模型在测试集上的评估结果为 modest F1-micro 41.3(P=58.1,R=32.1)。然而,通过结合高置信度与低变异来识别高质量预测、调优以提升精度,我们保留了19%的测试预测且精度达100%。我们在1800万篇PubMed摘要上评估了PPI-BioBERT-x10,抽取出160万条(546507个唯一PTM-PPI三元组)PTM-PPI预测,并筛选出约5700条(4584个唯一)高置信度预测。在这5700条中,对小随机子集的人工评估显示,尽管进行了置信度校准,精度仍降至33.7%,凸显了即便有置信度校准,在测试集之外泛化性的挑战。我们通过仅纳入与多篇论文相关的预测来规避该问题,将精度提升至58.8%。本工作强调了基于深度学习的文本挖掘在实践中的益处与挑战,以及为辅助人工整理工作而需更加重视置信度校准。

关键词

引用

@article{arxiv.2201.02229,
  title  = {Large-scale protein-protein post-translational modification extraction with distant supervision and confidence calibrated BioBERT},
  author = {Aparna Elangovan and Yuan Li and Douglas E. V. Pires and Melissa J. Davis and Karin Verspoor},
  journal= {arXiv preprint arXiv:2201.02229},
  year   = {2022}
}

备注

BMC BioInformatics