词性标注器错误未必会降低生物医学文本信息抽取的准确性
计算与语言
2008-04-03 v1 信息检索
摘要
最近的一项研究报道了 Muscorian 的开发,这是一种用于从文本中提取蛋白质-蛋白质相互作用的通用文本处理工具,其性能可与生物医学专用文本处理工具相媲美。这一结果出乎意料,因为一系列文本分析过程中产生的潜在错误很可能对整个处理流程的结果产生不利影响。大多数生物医学实体关系抽取工具都使用了生物医学专用的词性标注器,因为词性标注中的错误很可能影响文本的后续语义分析,如浅层句法分析。本研究旨在评估词性标注的准确性,并尝试探索当使用通用词性标注器 MontyTagger 替代在生物医学文本上训练的标注器 MedPost 时,是否能获得相当的性能。我们的结果表明,MontyTagger(即 Muscorian 的词性标注器)在生物医学文本上测试时的词性标注准确率为 83.1%。用 MedPost 替代 MontyTagger 并未在文本实体关系抽取上带来显著提升;在方向性关系上,MontyTagger 的准确率为 55.6%,而 MedPost 为 56.8%;在非方向性关系上,MontyTagger 为 86.1%,而 MedPost 为 81.8%。这出乎意料,因为 MontyTagger 词性标注不佳的潜在可能很可能会影响信息抽取的结果。对词性标注错误的分析表明,78.5% 的标注错误被浅层句法分析所补偿。因此,尽管标注准确率仅为 83.1%,MontyTagger 的功能标注准确率达到了 94.6%。
引用
@article{arxiv.0804.0317,
title = {Parts-of-Speech Tagger Errors Do Not Necessarily Degrade Accuracy in Extracting Information from Biomedical Text},
author = {Maurice HT Ling and Christophe Lefevre and Kevin R. Nicholas},
journal= {arXiv preprint arXiv:0804.0317},
year = {2008}
}