科学文献中方法与数据集实体挖掘:一种带自注意力的 CNN + Bi-LSTM 模型
人工智能
2021-01-29 v2
摘要
文献分析有助于研究者良好把握科学技术的发展。传统文献分析主要关注主题、作者、摘要、关键词、参考文献等文献元数据,很少关注论文的主体内容。在科学、计算、工程等诸多科学领域中,这些领域发表的科学论文所涉及的方法和数据集承载重要信息,对领域分析以及算法与数据集推荐都颇有用处。本文提出一种称为 MDER 的新颖实体识别模型,能够有效从科学论文的文本内容中抽取方法与数据集实体。该模型利用规则嵌入并采用 CNN 与 Bi-LSTM 带自注意力机制的并行结构。我们在由计算机科学四个研究领域(即 NLP、CV、数据挖掘与 AI)已发表论文构建的数据集上评估所提模型。实验结果表明我们的模型在所有四个领域均表现良好,并具备跨领域学习与识别的良好能力。我们还通过实验评估了模型内不同构建模块的有效性,表明不同构建模块对整体良好实体识别性能的共同贡献十分重要。我们模型上的数据增强实验表明数据增强对模型训练有正向贡献,使我们的模型在仅少量训练样本可用的场景下更加鲁棒。我们最终将模型应用于 2009–2019 年发表的 PAKDD 论文,以从更长时间跨度发表的科学论文中挖掘有洞察的结果。
引用
@article{arxiv.2010.13583,
title = {Method and Dataset Entity Mining in Scientific Literature: A CNN + Bi-LSTM Model with Self-attention},
author = {Linlin Hou and Ji Zhang and Ou Wu and Ting Yu and Zhen Wang and Zhao Li and Jianliang Gao and Yingchun Ye and Rujing Yao},
journal= {arXiv preprint arXiv:2010.13583},
year = {2021}
}