CEAR:从科学文献自动构建化学实体与角色知识图谱
计算工程、金融与科学
2025-01-24 v3 数值分析
数值分析
摘要
本体是特定领域知识的形式化表示,提供了组织和理解复杂信息的结构化框架。然而,创建本体是一个复杂且耗时的过程。ChEBI是一个在化学领域广为人知的本体,为定义化学实体及其属性提供了全面的资源。然而,它仅涵盖了化学知识快速增长领域的很小一部分,且不提供对科学文献的引用。为此,我们提出一种方法,通过 augmenting现有标注文本语料库与ChEBI知识,并微调大型语言模型(LLM)以识别科学文本中化学实体及其角色。我们的实验表明该方法有效。通过将本体知识与LLM的语言理解能力相结合,我们在识别科学文献中的化学实体和角色方面实现了高精度和高召回率。此外,我们从8000篇ChemRxiv文章中提取信息,并应用第二个LLM创建化学实体与角色知识图谱(CEAR),该图谱为ChEBI提供补充信息,可帮助扩展其范围。
引用
@article{arxiv.2407.21707,
title = {Tree-Cotree-Based Tearing and Interconnecting for 3D Magnetostatics: A Dual-Primal Approach},
author = {Mario Mally and Bernard Kapidani and Melina Merkel and Sebastian Schöps and Rafael Vázquez},
journal= {arXiv preprint arXiv:2407.21707},
year = {2025}
}
备注
Preprint submitted to Computer Methods in Applied Mechanics and Engineering