中文

通过大语言模型的单选题问答增强软件相关信息抽取

计算与语言 2024-04-23 v2

摘要

本文描述了我们参与软件提及消歧(SOMD)共享任务,重点是通过生成式大语言模型(LLM)利用单选题问答来改进学术文本中的关系抽取。该方法优先使用 GLM 的上下文学习能力来抽取与软件相关的实体及其描述性属性,例如分发信息。我们的方法使用检索增强生成(RAG)技术和 GLM 进行命名实体识别(NER)和属性 NER,以识别所抽取软件实体之间的关系,为分析学术文献中的软件引用提供结构化解决方案。本文详细描述了我们的方法,展示了在单选题问答范式中使用 GLM 如何能够极大地增强信息抽取(IE)方法。我们参与 SOMD 共享任务突出了精确软件引用实践的重要性,并展示了我们的系统克服消歧和抽取软件提及之间关系挑战的能力。这为该领域的未来研究与开发奠定了基础。

关键词

引用

@article{arxiv.2404.05587,
  title  = {Enhancing Software-Related Information Extraction via Single-Choice Question Answering with Large Language Models},
  author = {Wolfgang Otto and Sharmila Upadhyaya and Stefan Dietze},
  journal= {arXiv preprint arXiv:2404.05587},
  year   = {2024}
}

备注

Accepted at: 1st Workshop on Natural Scientific Language Processing and Research Knowledge Graphs (NSLP 2024) Co-located with Extended Semantic Web Conference (ESWC 2024)