中文

基于自然语言处理从大型聚合物语料库中通用材料属性数据抽取流水线

计算与语言 2023-04-06 v1 材料科学 软凝聚态物质

摘要

材料科学文章数量的不断增长使得从已发表文献中推断化学-结构-性能关系变得困难。我们使用自然语言处理(NLP)方法自动从聚合物文献摘要中抽取材料属性数据。作为流水线的一个组件,我们训练了MaterialsBERT这一语言模型,使用240万篇材料科学摘要,在作为文本编码器用于五个命名实体识别数据集中的三个时优于其他基线模型。利用该流水线,我们在60小时内从约13万篇摘要中获得了约30万条材料属性记录。抽取的数据针对燃料电池、超级电容器和聚合物太阳能电池等多种应用进行了分析,以恢复非平凡的见解。通过我们的流水线抽取的数据可通过 https://polymerscholar.org 的网页平台获取,可便捷地用于定位摘要中记录的材枓属性数据。本工作展示了从已发表文献出发到获得完整抽取材料属性信息这一自动流水线的可行性。

关键词

引用

@article{arxiv.2209.13136,
  title  = {A general-purpose material property data extraction pipeline from large polymer corpora using Natural Language Processing},
  author = {Pranav Shetty and Arunkumar Chitteth Rajan and Christopher Kuenneth and Sonkakshi Gupta and Lakshmi Prerana Panchumarti and Lauren Holm and Chao Zhang and Rampi Ramprasad},
  journal= {arXiv preprint arXiv:2209.13136},
  year   = {2023}
}