中文

Bench4KE:自动化能力问题生成的基准测试

计算与语言 2025-12-10 v3 人工智能

摘要

大型语言模型(LLM)的可用性为重振知识工程(KE)自动化研究提供了独特机遇。这一趋势在近期开发基于 LLM 的方法和工具以自动生成能力问题(CQ)的努力中已显而易见,CQ 是本体工程师用来定义本体功能需求的自然语言问题。然而,这些工具的评估缺乏标准化。这损害了方法论的严谨性,并阻碍了结果的复现与比较。为填补这一空白,我们推出了 Bench4KE,一个用于 KE 自动化的可扩展的基于 API 的基准测试系统。本次发布侧重于评估自动生成 CQ 的工具。Bench4KE 提供了一个精心策划的黄金标准,包含来自 17 个真实世界本体工程项目的 CQ 数据集,并使用一套相似度指标来评估所生成 CQ 的质量。我们对 6 个近期基于 LLM 的 CQ 生成系统进行了比较分析,为未来研究确立了基线。Bench4KE 的设计也旨在容纳额外的 KE 自动化任务,如 SPARQL 查询生成、本体测试与起草。代码和数据集均在 Apache 2.0 许可下公开发布。

关键词

引用

@article{arxiv.2505.24554,
  title  = {Bench4KE: Benchmarking Automated Competency Question Generation},
  author = {Anna Sofia Lippolis and Minh Davide Ragagni and Paolo Ciancarini and Andrea Giovanni Nuzzolese and Valentina Presutti},
  journal= {arXiv preprint arXiv:2505.24554},
  year   = {2025}
}