中文

使用新型线性模型与词语邻近网络在摘要与文本中揭示蛋白质相互作用

信息检索 2008-12-08 v1 机器学习

摘要

我们参加了第二届 BioCreative 挑战赛的三个蛋白质-蛋白质相互作用子任务:对与蛋白质-蛋白质相互作用相关的摘要进行分类 (IAS),在全文本文档中发现蛋白质对 (IPS) 以及表征蛋白质相互作用的文本段落 (ISS)。我们采用一种受垃圾邮件检测技术启发的新型轻量级线性模型以及基于不确定性的集成方案来处理摘要分类任务。为了进行比较,我们还在相同特征上使用了支持向量机和奇异值分解。我们处理全文本子任务(蛋白质对和段落识别)的方法包括一种基于词语邻近网络的特征扩展方法。在挑战赛评估所使用的性能指标(准确率、F分数和AUC)方面,我们处理摘要分类任务 (IAS) 的方法是该任务的顶级提交之一。我们还报告了使用我们的方法开发的一个网络工具:蛋白质相互作用摘要相关性评估器 (PIARE)。我们处理全文本任务的方法获得了最高的召回率之一,以及正确段落的平均倒数排名。我们处理摘要分类的方法表明,使用相对较少特征的简单线性模型,能够泛化并从文献组中揭示蛋白质-蛋白质相互作用的概念本质。由于这种新方法基于非常轻量级的线性模型,它可以轻松地被移植并应用于类似问题。在全文本问题中,用词语邻近网络扩展词语特征被证明是有用的,但也讨论了进一步改进的需求。

关键词

引用

@article{arxiv.0812.1029,
  title  = {Uncovering protein interaction in abstracts and text using a novel linear model and word proximity networks},
  author = {Alaa Abi-Haidar and Jasleen Kaur and Ana G. Maguitman and Predrag Radivojac and Andreas Retchsteiner and Karin Verspoor and Zhiping Wang and Luis M. Rocha},
  journal= {arXiv preprint arXiv:0812.1029},
  year   = {2008}
}