从文本到洞察:基于深度学习加速有机材料知识抽取
计算与语言
2021-09-28 v1 信息检索
摘要
科学文献是共享知识最重要的资源之一。研究人员将查阅科学文献作为设计实验的第一步。鉴于文献数量庞大且不断增长,阅读和手动抽取知识的常规方法过于耗时,造成了研究周期中的瓶颈。这一挑战几乎涉及所有科学领域。对于材料科学而言,分布在数百万篇出版物中的实验数据对预测材料性质和设计新材料极为有用。然而,直到最近研究人员才主要面向无机材料探索了用于知识抽取的计算方法。本研究旨在探索有机材料的知识抽取。我们构建了一个研究数据集,包含从92,667篇摘要中选取的855句标注句子和708,376句未标注句子。我们使用BiLSTM-CNN-CRF深度学习模型进行命名实体识别(NER),以自动从文献中抽取关键知识。早期结果显示出自动化知识抽取的很高潜力。本文介绍了我们的发现以及一个可适配其他科学领域的监督式知识抽取框架。
引用
@article{arxiv.2109.12758,
title = {Text to Insight: Accelerating Organic Materials Knowledge Extraction via Deep Learning},
author = {Xintong Zhao and Steven Lopez and Semion Saikin and Xiaohua Hu and Jane Greenberg},
journal= {arXiv preprint arXiv:2109.12758},
year = {2021}
}
备注
Accepted by the 84th Annual Meeting of the Association for Information Science and Technology (ASIS&T 2021), short paper