中文

深度学习应用于学术信息提取的经验:何种有效、何种无效及未来方向

信息检索 2022-07-11 v1 人工智能

摘要

理解全文学术论文中的关键洞见至关重要,因为这使我们能够确定有趣的趋势、洞悉研发活动并构建知识图谱。然而,部分有趣的关键洞见只有在考虑全文时才可获得。尽管研究者在短文档信息提取方面已取得显著进展,但从全文学术文献中提取科学实体仍是一个具有挑战性的问题。本工作提出一种称为 EneRex 的自动化端到端研究实体提取器,用于从全文学术研究论文中提取数据集使用、目标任务、方法等技术侧面。此外,我们从全文论文中提取了三个新颖侧面,例如源代码链接、计算资源、编程语言/库。我们展示了 EneRex 如何从计算机科学领域的大规模数据集中提取关键洞见与趋势。我们进一步在多个数据集上测试了我们的流程,发现 EneRex 优于一个 SOTA 模型。我们强调了现有数据集在能力上的局限,以及 EneRex 如何可融入现有知识图谱。我们还给出了带有未来研究指向的详细讨论。我们的代码与数据公开于 https://github.com/DiscoveryAnalyticsCenter/EneRex。

关键词

引用

@article{arxiv.2207.04029,
  title  = {Lessons from Deep Learning applied to Scholarly Information Extraction: What Works, What Doesn't, and Future Directions},
  author = {Raquib Bin Yousuf and Subhodip Biswas and Kulendra Kumar Kaushal and James Dunham and Rebecca Gelles and Sathappan Muthiah and Nathan Self and Patrick Butler and Naren Ramakrishnan},
  journal= {arXiv preprint arXiv:2207.04029},
  year   = {2022}
}

备注

ACM KDD 2022 Workshop on Data-driven Science of Science