基于知识图谱和大语言模型的科学文章问答抽取
计算与语言
2025-07-21 v1 信息检索
机器学习
摘要
在决定是否阅读文章或将其纳入研究时,学者往往希望快速识别和理解其主要思想。本文旨在以问答(QA)对的形式从科学文章中提取这些关键概念和贡献。我们提出了两种不同的QA生成方法。第一种方法涉及选择显著段落,使用大语言模型(LLM)生成问题,对这些问题按获取有意义答案的概率进行排序,然后生成答案。该方法完全依赖于文章内容。然而,评估文章的新颖性通常需要与现有文献进行比较。因此,我们的第二种方法利用知识图谱(KG)进行QA生成。我们通过在科学文章上微调实体关系(ER)抽取模型来构建KG,然后使用显著三元组抽取方法选择每个文章最相关的ER,利用基于三元组TF-IDF类似度度量的实体中心性等指标。该度量基于文章内重要性与文献中普遍性之间的比较来评估三元组的显著性。对于评估,我们使用两种方法生成QA,并通过一组预定义的指标让受资质专业人员(SME)评估问题和答案的质量。我们的评估表明,KG方法有效地捕捉了文章中讨论的主要思想。此外,我们的发现表明,对科学语料库进行ER抽取模型的微调对于从此类文档中提取高质量的三元组至关重要。
引用
@article{arxiv.2507.13827,
title = {Question-Answer Extraction from Scientific Articles Using Knowledge Graphs and Large Language Models},
author = {Hosein Azarbonyad and Zi Long Zhu and Georgios Cheirmpos and Zubair Afzal and Vikrant Yadav and Georgios Tsatsaronis},
journal= {arXiv preprint arXiv:2507.13827},
year = {2025}
}
备注
SIGIR 2025