从科学文献中提取氧还原反应催化剂信息
计算与语言
2025-07-11 v1 数据分析、统计与概率
摘要
氧还原反应(ORR)催化剂在提升燃料电池效率方面发挥着关键作用,成为材料科学研究的热点。然而,从庞大的科学文献中提取结构化的 ORR 催化剂信息仍是一大挑战,主要由于文本数据的复杂性和多样性。本研究提出一种基于 DyGIE++ 的命名实体识别(NER)和关系抽取(RE)方法,采用多个预训练的 BERT 模型(包括 MatSciBERT 和 PubMedBERT),从科学文献中抽取 ORR 催化剂相关信息,构建用于材料信息学的燃料电池语料库(FC-CoMIcs)。我们手动识别 12 个关键实体和实体对之间的两种关系类型,构建了全面的数据集。我们的 метод论包括数据标注、集成和 transformer 模型的微调,以提升信息抽取准确性。我们评估了不同 BERT 模型对抽取性能的影响,并研究了标注一致性的效果。实验结果显示,微调的 PubMedBERT 模型在 NER 上取得最高的 F1 分数 82.19\%,而 MatSciBERT 模型在 RE 上获得最佳 F1 分数 66.10\%。此外,与人类标注者的比较表明,微调模型在 ORR 催化剂抽取中具有可靠性,显示出其在可扩展自动化文献分析中的潜力。结果表明,领域特定的 BERT 模型在 ORR 催化剂抽取中优于通用科学模型如 BlueBERT。
引用
@article{arxiv.2507.07499,
title = {Extracting ORR Catalyst Information for Fuel Cell from Scientific Literature},
author = {Hein Htet and Amgad Ahmed Ali Ibrahim and Yutaka Sasaki and Ryoji Asahi},
journal= {arXiv preprint arXiv:2507.07499},
year = {2025}
}
备注
28 pages, 12 figures, 6 tables