中文

利用学术论文全文内容识别并评估自然语言处理领域的算法实体

计算与语言 2020-10-22 v1 信息检索 机器学习

摘要

在大数据时代,算法在学术研究中的推进、改进与应用对促进不同学科的发展起到了重要作用。各学科学术论文,尤其是计算机科学,包含大量算法。从论文全文内容中识别算法可确定特定领域中的热门或经典算法,并帮助学者全面理解算法乃至整个领域。为此,本文以自然语言处理(NLP)领域为例,从该领域学术论文中识别算法。通过人工标注论文内容构建算法词典,并基于词典匹配抽取含词典中算法的句子。以提及某算法的文章数量作为指标来分析该算法的影响力。我们的结果揭示了 NLP 论文中影响力最高的算法,并表明分类算法在高影响力算法中占比最大。此外,算法影响力的演变反映了该领域研究任务与主题的变化,不同算法影响力的变化呈现不同趋势。作为一项初步探索,本文对学术文本中提及的算法影响进行分析,结果可用作未来大规模算法自动抽取的训练数据。本文方法具有领域无关性,可应用于其他领域。

关键词

引用

@article{arxiv.2010.10817,
  title  = {Using the Full-text Content of Academic Articles to Identify and Evaluate Algorithm Entities in the Domain of Natural Language Processing},
  author = {Yuzhuo Wang and Chengzhi Zhang},
  journal= {arXiv preprint arXiv:2010.10817},
  year   = {2020}
}