中文

评估在开放研究知识图谱(ORKG)中使用大语言模型(LLMs)进行属性提取的改进

信息检索 2025-02-18 v1 人工智能 计算与语言

摘要

当前的研究突显了大语言模型在构建学术知识图谱方面的巨大潜力。该过程中一个尤为复杂的步骤是关系提取,旨在识别合适的属性来描述研究内容。本研究直接建立在 Open Research Knowledge Graph (ORKG) 团队三名成员先前的研究之上,他们评估了 GPT-3.5、Llama 2 和 Mistral 等 LLM 在科学文献属性提取方面的准备情况。鉴于观察到的中等性能,先前的工作得出结论:需要微调来提升这些模型与科学任务的对齐程度及其对人类专业知识的模仿。在先前实验的基础上,本研究评估了高级提示工程技术的效果,并证明这些技术能极其显著地提升结果。此外,本研究将属性提取过程扩展为包含与通过 API 检索到的现有 ORKG 属性的属性匹配。评估表明,通过高级提示工程生成的结果实现了与 ORKG 属性更高比例的匹配,进一步强调了所实现的对齐增强。此外,这为应对诸如 ORKG 属性不一致等挑战(先前研究中强调的一个问题)奠定了基础。通过分配唯一的 URI 并使用标准化术语,这项工作提高了属性的一致性,实现了链接数据和 FAIR 原则的一个关键方面——这是 ORKG 的核心承诺。这反过来显著增强了 ORKG 内容在后续任务(如研究出版物的比较)中的适用性。最后,本研究以对整体属性提取过程的未来改进建议作为结论。

关键词

引用

@article{arxiv.2502.10768,
  title  = {Evaluating improvements on using Large Language Models (LLMs) for property extraction in the Open Research Knowledge Graph (ORKG)},
  author = {Sandra Schaftner},
  journal= {arXiv preprint arXiv:2502.10768},
  year   = {2025}
}