大语言模型会梦见本体吗?
计算与语言
2025-04-02 v2 人工智能
摘要
大语言模型 (LLM) 在多种自然语言处理任务中展现了卓越的性能,然而它们记忆结构化知识的能力仍未得到充分探索。本文研究了通用预训练 LLM 在多大程度上能保留并正确复现来自公开本体的概念标识符(ID)与标签之间的关联。我们利用 Pythia-12B、Gemini-1.5-Flash、GPT-3.5 和 GPT-4 等 LLM,对包括基因本体(Gene Ontology)、Uberon、维基数据(Wikidata)和 ICD-10 在内的多个本体资源进行了系统评估。我们的发现表明,只有一小部分本体概念被准确记忆,其中 GPT-4 表现最佳。为了理解为何某些概念比其他概念记忆得更有效,我们分析了记忆准确性与概念在 Web 上的流行度之间的关系。结果表明,概念在线出现的频率与其 ID 从标签中被准确检索的可能性之间存在强相关性。这表明 LLM 主要通过间接的文本接触获取此类知识,而非直接来自结构化的本体资源。此外,我们引入了新的度量标准来量化预测不变性,证明模型响应在提示语言和温度设置变化下的稳定性可以作为估计记忆鲁棒性的代理指标。
引用
@article{arxiv.2401.14931,
title = {Do LLMs Dream of Ontologies?},
author = {Marco Bombieri and Paolo Fiorini and Simone Paolo Ponzetto and Marco Rospocher},
journal= {arXiv preprint arXiv:2401.14931},
year = {2025}
}