中文

使用Bi-LSTM-CRF模型在科学文章中提取数据集提及

计算与语言 2024-05-24 v1 机器学习

摘要

数据集对于科学研究至关重要,在复制、可重复性和效率方面发挥着重要作用。研究人员最近表明,数据集对于科学正常运作变得越来越重要,甚至本身成为研究对象。然而,尽管数据存储库和资助机构最近做出了努力,但引用数据集并不是常见或标准的做法。这极大地影响了我们追踪其使用和重要性的能力。解决这个问题的一个潜在方案是从科学文章中自动提取数据集提及。在本文中,我们提出使用基于Bi-LSTM-CRF架构的神经网络来实现这种提取。我们的方法在Rich Context Dataset发布的社会科学文章中达到了F1=0.885。我们讨论了当前数据集的局限性,并提出了未来对模型进行的修改。

关键词

引用

@article{arxiv.2405.13135,
  title  = {Dataset Mention Extraction in Scientific Articles Using Bi-LSTM-CRF Model},
  author = {Tong Zeng and Daniel Acuna},
  journal= {arXiv preprint arXiv:2405.13135},
  year   = {2024}
}