中文

NaïveRole:从生物医学稿件中抽取与解析作者贡献

计算与语言 2019-12-24 v1 数字图书馆 信息检索 机器学习 机器学习

摘要

关于个体作者对科学出版物的贡献信息对于评估作者成就十分重要。部分生物医学出版物含有一个描述作者角色与贡献的简短章节。其通常以自然语言书写,因此作者贡献无法轻易以机器可读格式抽取。本文中,我们提出 1)对作者贡献章节中角色的统计性分析,以及 2)NaïveRole,一种从作者贡献章节抽取结构化作者角色的新方法。第一部分中,我们使用共聚类技术以及开放信息抽取,在来自 PubMed Central 的 2,000 个贡献章节语料上半自动地发现了流行角色。所发现的角色被用于基于朴素贝叶斯自动构建我们角色抽取方法 NaïveRole 的训练集。NaïveRole 抽取角色的微平均精确率为 0.68、召回率为 0.48、F1 为 0.57。据我们所知,这是自动从研究论文抽取作者角色的首次尝试。本文为 JCDL 2018 发表的海报的扩展版本。

关键词

引用

@article{arxiv.1912.10170,
  title  = {Na\"iveRole: Author-Contribution Extraction and Parsing from Biomedical Manuscripts},
  author = {Dominika Tkaczyk and Andrew Collins and Joeran Beel},
  journal= {arXiv preprint arXiv:1912.10170},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1802.01174