基于大语言模型的本体学习:公理识别基准研究
人工智能
2025-12-08 v1 计算与语言
摘要
本体是结构化领域知识的重要工具,但其开发是一项复杂任务,需要大量的建模和领域专业知识。本体学习旨在自动化这一过程,过去十年中随着自然语言处理技术的进步而取得了发展,尤其是随着大型语言模型(LLM)的近期增长。本文研究了识别公理的挑战:定义类和属性之间逻辑关系的基本本体组件。在这项工作中,我们引入了一个本体公理基准OntoAxiom,并系统地在该基准上测试LLM进行公理识别,评估了不同的提示策略、本体和公理类型。该基准由九个中等规模本体组成,共包含17,118个三元组和2,771条公理。我们聚焦于子类、不相交、子属性、域和范围公理。为评估LLM性能,我们比较了12个LLM,采用三种少样本设置和两种提示策略:直接方法一次性查询所有公理,以及逐条公理(AbA)方法,每个提示仅查询一条公理。我们的结果表明,AbA提示策略比直接方法获得更高的F1分数。然而,不同公理类型的性能存在差异,表明某些公理更难识别。领域也影响性能:FOAF本体在子类公理上得分为0.642,而音乐本体仅达到0.218。更大的LLM优于较小的LLM,但较小的模型在资源受限的设置中仍然可行。尽管整体性能尚不足以完全自动化公理识别,但LLM可以为本体工程师提供有价值的候选公理,支持本体的开发和优化。
引用
@article{arxiv.2512.05594,
title = {Ontology Learning with LLMs: A Benchmark Study on Axiom Identification},
author = {Roos M. Bakker and Daan L. Di Scala and Maaike H. T. de Boer and Stephan A. Raaijmakers},
journal= {arXiv preprint arXiv:2512.05594},
year = {2025}
}
备注
Submitted to Semantic Web Journal, under review