用于科研论文潜在影响自动评估的语义分析
计算与语言
2021-04-28 v1 信息论
机器学习
math.IT
摘要
对科学论文文本中所用词词语义的的分析能否预测其以引文衡量的未来影响?本研究详述了自动文本分类的实例,其在区分高被引与低被引文章方面取得了 80% 的成功率。自动智能系统能够识别可能在科学界产生影响力的有前景的工作。自自然语言处理诞生以来,量化文本意义与表示人类语言的问题便已明确。本文提出一种基于信息论的文本意义向量表示方法,并展示该信息语义如何用于基于 Leicester Scientific Corpus 的文本分类。我们描述了通过信息语义评估科学论文影响的实验框架。我们的兴趣在于引文分类,以发现文本语义在预测引文数量方面的重要程度。我们提出文本语义作为引文预测的重要因素。对于每篇文章,我们的系统提取论文摘要,将摘要中的词表示为意义空间中的向量,自动分析摘要文本中科学类别(Web of Science 类别)的分布,然后根据引文数量(高被引、低被引)对论文进行分类。我们表明,表示文本意义的信息论方法为有效预测研究论文的科学影响提供了一条途径。
引用
@article{arxiv.2104.12869,
title = {Semantic Analysis for Automated Evaluation of the Potential Impact of Research Articles},
author = {Neslihan Suzen and Alexander Gorban and Jeremy Levesley and Evgeny Mirkes},
journal= {arXiv preprint arXiv:2104.12869},
year = {2021}
}
备注
36 pages