NaïveRole:从生物医学稿件中抽取与解析作者贡献
计算与语言
2019-12-24 v1 数字图书馆
信息检索
机器学习
机器学习
摘要
关于个体作者对科学出版物的贡献信息对于评估作者成就十分重要。部分生物医学出版物含有一个描述作者角色与贡献的简短章节。其通常以自然语言书写,因此作者贡献无法轻易以机器可读格式抽取。本文中,我们提出 1)对作者贡献章节中角色的统计性分析,以及 2)NaïveRole,一种从作者贡献章节抽取结构化作者角色的新方法。第一部分中,我们使用共聚类技术以及开放信息抽取,在来自 PubMed Central 的 2,000 个贡献章节语料上半自动地发现了流行角色。所发现的角色被用于基于朴素贝叶斯自动构建我们角色抽取方法 NaïveRole 的训练集。NaïveRole 抽取角色的微平均精确率为 0.68、召回率为 0.48、F1 为 0.57。据我们所知,这是自动从研究论文抽取作者角色的首次尝试。本文为 JCDL 2018 发表的海报的扩展版本。
引用
@article{arxiv.1912.10170,
title = {Na\"iveRole: Author-Contribution Extraction and Parsing from Biomedical Manuscripts},
author = {Dominika Tkaczyk and Andrew Collins and Joeran Beel},
journal= {arXiv preprint arXiv:1912.10170},
year = {2019}
}
备注
arXiv admin note: substantial text overlap with arXiv:1802.01174