中文

通过挖掘主谓宾中间项重构蛋白质 - 蛋白质相互作用通路

信息检索 2007-08-07 v1 计算与语言 数字图书馆

摘要

新文章发表率的指数级增长限制了研究人员获取相关文献的能力。这促使人们使用文本挖掘工具来提取关键的生物学信息。先前的研究报道了对现有通用文本处理器进行大量修改以处理生物学文本的情况。然而,这种修改的必要性尚未得到检验。在本研究中,我们利用通用文本处理器 MontyLingua 构建了 Muscorian 系统。该系统采用了先前提出的一种双层泛化 - 特化范式,即先将文本通用处理为合适的中间格式,然后在特化层应用领域特定的数据提取技术。利用语料库和专家进行的评估表明,在提取蛋白质 - 蛋白质相互作用方面,其精确度为 86-90%,召回率约为 30%,这与使用专用生物学文本处理工具或修改后的现有工具的先前研究结果相当。我们的研究还通过使用相同的泛化层执行两项 specialized 信息提取任务,证明了双层泛化 - 特化范式的灵活性。

关键词

引用

@article{arxiv.0708.0694,
  title  = {Reconstruction of Protein-Protein Interaction Pathways by Mining Subject-Verb-Objects Intermediates},
  author = {Maurice HT Ling and Christophe Lefevre and Kevin R. Nicholas and Feng Lin},
  journal= {arXiv preprint arXiv:0708.0694},
  year   = {2007}
}

评论

2nd IAPR Workshop on Pattern Recognition in Bioinformatics (PRIB 2007). 14 pages, 4 figures

R2 v1 2026-06-29T02:19:43.414Z