VSPO:基于 LLM 的语义误区验证方法用于本体论中的语义陷阱
人工智能
2025-11-19 v2
摘要
容错问题(Competency Questions, CQs)在验证本体论设计中起着关键作用。虽然手动编写 CQs 对于本体论工程师来说耗时且成本高昂,但近期研究探索了利用大语言模型(LLMs)自动生成此过程。然而,现有方法主要基于与现有数据集的相似性来评估生成的 CQs,往往无法验证诸如“误用 allValuesFrom”等语义陷阱。由于此类陷阱无法通过基于规则的方法可靠检测,本文提出一种 novel 数据集和模型,用于验证本体论中的语义陷阱(Validating Semantic Pitfalls in Ontology, VSPO),旨在为 CQ 生成专门验证语义陷阱。为模拟缺失和误用的公理,我们使用 LLMs 生成类的和属性的自然语言定义,并通过删除公理或改变逻辑运算符(例如,用交集替换并集)在定义与本体之间引入不一致。随后,我们对 LLaMA-3.1-8B-Instruct 进行微调,以生成这些定义与相应公理之间语义差异的 CQs。生成的 CQs 能够检测现有公开数据集所能检测的更广泛范围的建模错误。我们的微调模型在基线模型中表现优异,相较于 GPT-4.1 在陷阱验证生成 CQs 时,精度提升 26%,召回率提升 28.2%。本研究实现了使用 LLMs 自动生成 TBox 验证 CQs,显著减少了手动工作,同时改善了本体论与专家知识之间的语义对齐。据我们了解,这是首个针对语义陷阱验证的 CQ 生成使用 LLMs 的研究。
引用
@article{arxiv.2511.07991,
title = {VSPO: Validating Semantic Pitfalls in Ontology via LLM-Based CQ Generation},
author = {Hyojun Choi and Seokju Hwang and Kyong-Ho Lee},
journal= {arXiv preprint arXiv:2511.07991},
year = {2025}
}
备注
Accepted at AAAI 2026 oral