中文

文本到电池配方:基于语言模型的自动电池配方提取与检索协议

计算与语言 2024-07-23 v1 材料科学

摘要

近期研究越来越多地将自然语言处理(NLP)应用于从大量电池材料文献中自动提取实验研究数据。尽管电池制造过程复杂,涵盖从材料合成到电池组装的各个环节,但尚无系统性地组织这一信息的综合性研究。为此,我们提出了一种基于语言模型的协议,称为文本到电池配方(Text-to-Battery Recipe, T2BR),用于自动提取端到端的电池配方,并以含锰氧化钙(LiFePO4)阳极材料的电池为案例进行验证。我们报告了基于机器学习的论文过滤模型,对筛选出 2,174 篇相关论文;以及基于无监督主题模型的段落识别,分别识别出与阴极合成相关的 2,876 段文本和与电池组装相关的 2,958 段文本。随后,针对这两个主题,我们开发了两个基于深度学习的命名实体识别模型,提取出 30 种实体(包括前驱体、活性材料和合成方法),实现 F1 分数分别为 88.18% 和 94.61%。精准的实体提取使得能够系统地生成 165 套锰氧化钙电池的端到端配方。我们的协议和结果为特定趋势(如前驱体材料与合成方法之间的关联,或不同前驱体材料之间的组合)提供了宝贵见解。我们预计,这些发现将为促进电池配方信息检索提供基础知识库。该提议的协议将显著加速电池材料文献的审查,并催化电池设计与开发的创新。

关键词

引用

@article{arxiv.2407.15459,
  title  = {Text-to-Battery Recipe: A language modeling-based protocol for automatic battery recipe extraction and retrieval},
  author = {Daeun Lee and Jaewoong Choi and Hiroshi Mizuseki and Byungju Lee},
  journal= {arXiv preprint arXiv:2407.15459},
  year   = {2024}
}