用于科学文献中致谢实体自动抽取与分类的嵌入模型评估
计算与语言
2022-06-23 v1 数字图书馆
摘要
科学论文中的致谢可揭示科学共同体的某些方面,如奖励体系、合作模式与隐藏的研究趋势。本文旨在评估不同嵌入模型在科学论文致谢文本中致谢实体自动抽取与分类任务上的性能。我们使用 Flair NLP 框架训练并实现了命名实体识别(NER)任务。训练采用三个默认 Flair NER 模型与两个不同规模的语料库进行。在较大训练语料上训练的 Flair Embeddings 模型取得了 0.77 的最佳准确率。我们的模型能识别六类实体:资助机构、 grant number(资助号)、个人、大学、企业与杂项。该模型对某些实体类型的识别精度高于其他类型,其中个人与资助号的 F1 值超过 0.9。以往多数致谢分析工作受限于数据的人工评估,因而受限于处理数据量。该模型可用于致谢文本的全面分析,并可能对该自动致谢分析领域作出重要贡献。
引用
@article{arxiv.2206.10939,
title = {Evaluation of Embedding Models for Automatic Extraction and Classification of Acknowledged Entities in Scientific Documents},
author = {Nina Smirnova and Philipp Mayr},
journal= {arXiv preprint arXiv:2206.10939},
year = {2022}
}
备注
Accepted workshop paper at EEKE2022 Workshop(JCDL2022)