利用结构化知识库增强大型语言模型的元数据规范化
人工智能
2025-02-24 v5 计算与语言
信息检索
摘要
元数据在确保数据集的可发现性、可访问性、互操作性和可重用性方面发挥着关键作用。本文研究了大型语言模型(LLMs),特别是 GPT-4,在提高对元数据标准遵循度方面的潜力。我们在 NCBI BioSample 库中随机抽取了 200 条与肺癌人类样本相关的数据记录进行实验,评估了 GPT-4 提出编辑建议以遵循元数据标准的能力。我们通过同行评审过程计算了字段名-字段值对的遵循准确率,观察到对标准数据字典的平均遵循率从 79% 提升至 80%(p<0.5),仅有边际改善。随后,我们以 CEDAR 模板的文本描述形式向 GPT-4 提供领域信息,记录到遵循率从 79% 显著提升至 97%(p<0.01)。这些结果表明,尽管 LLMs 在无辅助情况下可能无法纠正遗留元数据以确保对标准的满意遵循,但当与结构化知识库集成时,它们在自动化元数据规范化方面确实展现出应用前景。
引用
@article{arxiv.2404.05893,
title = {Use of a Structured Knowledge Base Enhances Metadata Curation by Large Language Models},
author = {Sowmya S. Sundaram and Benjamin Solomon and Avani Khatri and Anisha Laumas and Purvesh Khatri and Mark A. Musen},
journal= {arXiv preprint arXiv:2404.05893},
year = {2025}
}