中文

学术 Wikidata:利用 LLM 在 Wikidata 中填充与探索会议数据

数字图书馆 2024-11-14 v1 人工智能 信息检索

摘要

已有多项举措利用本体对学术数据领域进行概念建模并创建相应知识图谱。然而,其全部潜力似乎尚未释放,因为缺乏自动填充此类本体的手段,且语义网社区的相关举措未必相互关联:我们提出利用 Wikidata 的基础设施,通过 LLM 从非结构化来源(如会议网站和论文集文本)以及现有结构化会议数据集中自动填充 Wikidata,以更可持续地获取学术数据。初步分析显示语义网会议在 Wikidata 中仅有极少表示,我们主张我们的方法论有助于在 Wikidata 内将学术数据作为一个社区进行填充、演进与维护。我们的主要贡献包括:(a)分析表示学术数据的本体以识别 Wikidata 中的空白与相关实体/属性;(b)半自动提取——需(最少)人工验证——会议元数据(如录用率、组织者角色、程序委员会成员、最佳论文奖、主题报告和赞助商),从网站和论文集文本中利用 LLM 提取。最后,我们讨论(c)在 Wikidata 语境下对可视化工具的扩展,以探索生成的学术数据。我们的研究聚焦于 105 个语义网相关会议的数据,在 Wikidata 中新增/扩展了 6000 多个实体。值得注意的是,该方法可更普遍地适用于语义网相关会议之外,以增强 Wikidata 作为综合性学术资源的效用。源代码仓库:https://github.com/scholarly-wikidata/ DOI:https://doi.org/10.5281/zenodo.10989709 许可证:Creative Commons CC0(数据),MIT(代码)

关键词

引用

@article{arxiv.2411.08696,
  title  = {Scholarly Wikidata: Population and Exploration of Conference Data in Wikidata using LLMs},
  author = {Nandana Mihindukulasooriya and Sanju Tiwari and Daniil Dobriy and Finn Årup Nielsen and Tek Raj Chhetri and Axel Polleres},
  journal= {arXiv preprint arXiv:2411.08696},
  year   = {2024}
}

备注

17 pages, accepted at EKAW-24