面向特定领域学术论文的未来工作句自动识别与分类
计算与语言
2022-12-29 v1 数字图书馆
摘要
未来工作句(FWS)是学术论文中蕴含作者对其提出的后续研究方向描述的特定句子。本文提出从学术论文中自动抽取FWS并根据论文内容所体现的不同未来方向对其进行分类的方法。FWS识别方法将使后续研究者能够更准确快速地定位未来工作句,并降低语料获取的时间与成本。当前关于未来工作句自动识别的研究相对较少,且现有研究无法从学术论文中准确识别FWS,因而无法开展大规模数据挖掘。此外,未来工作的内容涉及多个方面,对内容进行细分有助于分析具体发展方向。本文以自然语言处理(NLP)为案例,从学术论文中抽取FWS并划分为不同类型。我们人工构建了含有六类不同FWS的标注语料。随后,使用机器学习模型实现FWS的自动识别与分类,并基于评价指标比较这些模型的性能。结果表明,伯努利贝叶斯模型在自动识别任务中性能最佳,宏F1达到90.73%;SCIBERT模型在自动分类任务中性能最佳,加权平均F1达到72.63%。最后,我们从FWS中抽取关键词以深入理解其所描述的关键内容,并通过度量未来工作句与摘要之间的相似度,证明FWS中的内容确定将反映于后续研究工作中。
引用
@article{arxiv.2212.13860,
title = {Automatic Recognition and Classification of Future Work Sentences from Academic Articles in a Specific Domain},
author = {Chengzhi Zhang and Yi Xiang and Wenke Hao and Zhicheng Li and Yuchen Qian and Yuzhuo Wang},
journal= {arXiv preprint arXiv:2212.13860},
year = {2022}
}