基于ontology约束LLM代理的生物医学遗留元数据自动标准化
数据库
2026-04-13 v1 人工智能
摘要
科学元数据常常不完整且不符合社区标准,限制了数据集的可发现性、可互操作性和可重复使用性。当存在报告指南时,它们通常缺乏机器可操作的表示。生产符合 FAIR 标准的数据集需要将元数据标准编码为具有丰富字段规范和精确值约束的机器可操作模板。最近的工作表明,受ontology约束指导的 LLM 可提高元数据标准化,但这些方法将约束视为静态文本提示,依赖模型的训练知识。我们提出了一个查询权威生物医学术语服务的 LLM 基于元数据的标准化系统,以便按需检索准确的词汇术语。我们在 Human BioMolecular Atlas Program (HuBMAP) 的 839 条遗留元数据记录上进行评估,使用专家精选的金标准进行精确匹配评估。我们的评估表明,与 LLM 本身相比,增强 LLM 的实时工具访问在ontology约束和非ontology约束字段上 consistently 提高了预测准确率,表明这是一个实用且可扩展的生物医学元数据自动标准化方法。
引用
@article{arxiv.2604.08552,
title = {Automated Standardization of Legacy Biomedical Metadata Using an Ontology-Constrained LLM Agent},
author = {Josef Hardi and Martin J. O'Connor and Marcos Martinez-Romero and Jean G. Rosario and Stephen A. Fisher and Mark A. Musen},
journal= {arXiv preprint arXiv:2604.08552},
year = {2026}
}