中文

基于大语言模型的天体物理期刊论文天文知识实体抽取

天体物理仪器与方法 2024-01-18 v2

摘要

天文知识实体(如天体标识符)对于文献检索、知识图谱构建以及天文学领域的其他研究与应用至关重要。传统的从文本中抽取知识实体的方法面临人工成本高、泛化性差、维护昂贵等挑战。因此,迫切需求改进方法以高效抽取此类实体。本研究探索了预训练大语言模型(LLMs)利用提示从天体物理期刊论文中执行天文知识实体抽取(KEE)任务的潜力。我们提出一种称为 Prompt-KEE 的提示策略,包含五个提示要素,并基于它们设计了八种组合提示。选取天体标识符和望远镜名称这两个最典型的天文知识实体作为实验对象。我们引入了四个当前具代表性的 LLMs,即 Llama-2-70B、GPT-3.5、GPT-4 和 Claude 2。为适配其 token 限制,我们构建了两个数据集:30 篇论文的全文与段落集合。利用八种提示,我们在全文上用 GPT-4 和 Claude 2 测试,在段落集合上用所有 LLMs 测试。实验结果表明,预训练 LLMs 在天体物理期刊论文中执行 KEE 任务具有显著潜力,但其性能存在差异。此外,我们分析了影响 LLMs 实体抽取性能的一些重要因素,并为未来利用 LLMs 进行天体物理论文 KEE 任务提供了见解。

关键词

引用

@article{arxiv.2310.17892,
  title  = {Astronomical Knowledge Entity Extraction in Astrophysics Journal Articles via Large Language Models},
  author = {Wujun Shao and Pengli Ji and Dongwei Fan and Yaohua Hu and Xiaoran Yan and Chenzhou Cui and Linying Mi and Lang Chen and Rui Zhang},
  journal= {arXiv preprint arXiv:2310.17892},
  year   = {2024}
}