中文

基于大语言模型的 GitHub 隐藏实体检测

计算与语言 2025-01-09 v1 数字图书馆

摘要

命名实体识别是构建知识库时从非结构化数据源中处理的重要任务。虽然实体检测方法大多依赖大量训练数据,但大语言模型(LLM)为基于零样本学习(ZSL)或少样本学习(FSL)的方法开辟了新路径,这些方法利用了 LLM 在预训练期间所获得的能力。特别是在缺乏大规模训练数据的高度专业场景中,ZSL/FSL 开辟了新的机遇。本文沿袭这一趋势,探讨了利用大语言模型(LLM)在此类场景中自动检测 GitHub 文本内容中数据集和软件的潜力。虽然现有方法仅关注命名实体,但本研究旨在拓展范围,纳入诸如存储库和在线中心等资源,其中实体也通过 URL 表示。本文探讨了不同的 FSL 提示学习方法,以增强 LLM 识别存储库文本中数据集和软件提及的能力。通过对 LLM 有效性和学习策略的分析,本文为先进语言模型在自动化实体检测中的潜力提供了见解。

关键词

引用

@article{arxiv.2501.04455,
  title  = {Hidden Entity Detection from GitHub Leveraging Large Language Models},
  author = {Lu Gan and Martin Blum and Danilo Dessi and Brigitte Mathiak and Ralf Schenkel and Stefan Dietze},
  journal= {arXiv preprint arXiv:2501.04455},
  year   = {2025}
}

备注

accepted by KDD2024 workshop DL4KG