利用大语言模型标注主题元数据:澳大利亚国家研究数据目录中的案例研究
计算与语言
2023-10-18 v1 人工智能
摘要
为支持开放与可重复研究,可供研究使用的数据集数量正快速增加。随着数据集可用性的提升,拥有高质量元数据以发现和重用它们变得愈发重要。然而,由于数据策展资源有限,数据集常缺乏高质量元数据是一个普遍问题。与此同时,人工智能与大语言模型(LLMs)等技术正迅速发展。近来,基于这些技术的系统(如 ChatGPT)已展现出在某些数据策展任务上的可观能力。本文提出借助 LLM 通过基于 LLM 的上下文学习来实现高性价比的主题元数据标注。我们的方法采用 GPT-3.5 并设计用于标注主题元数据的提示,在自动元数据标注中展现出良好性能。然而,基于上下文学习的模型无法习得学科特定规则,导致在若干类别上性能较低。该局限源于可用于主题推断的上下文信息有限。据我们所知,我们首次引入了利用大语言模型进行自动化主题元数据标注的上下文学习方法。
引用
@article{arxiv.2310.11318,
title = {Utilising a Large Language Model to Annotate Subject Metadata: A Case Study in an Australian National Research Data Catalogue},
author = {Shiwei Zhang and Mingfang Wu and Xiuzhen Zhang},
journal= {arXiv preprint arXiv:2310.11318},
year = {2023}
}