CompoST:分析大语言模型在QALD设置中组合解释问题能力的基准
人工智能
2025-10-31 v2 计算与语言
摘要
语言解释是一个组合过程,其中更复杂语言结构的意义是从其组成部分的意义推断出来的。大型语言模型拥有卓越的语言解释能力,并已成功应用于通过将问题映射到SPARQL查询来解释问题。一个悬而未决的问题是这种解释过程的系统性如何。针对这个问题,在本文中,我们提出了一个基准,用于调查LLM解释问题的能力在多大程度上实际上是组合性的。为此,我们基于DBpedia中的图模式,并依赖Lemon词典进行语言表达,生成了三个难度不同的数据集。我们的数据集以高度可控的方式创建,以测试LLM在已知原子构建块的情况下解释结构复杂问题的能力。这使我们能够评估LLM在多大程度上能够解释它们“理解”其原子部分的复杂问题。我们使用不同大小的模型进行了实验,采用了各种提示和少样本优化技术以及微调。我们的结果表明,随着与优化样本的偏差增加,宏的性能从下降到再到。即使在输入中向模型提供了所有必要信息,对于复杂度最低的数据集,分数也不超过。因此,我们得出结论,LLM难以系统地和组合地解释问题并将其映射到SPARQL查询。
引用
@article{arxiv.2507.21257,
title = {CompoST: A Benchmark for Analyzing the Ability of LLMs To Compositionally Interpret Questions in a QALD Setting},
author = {David Maria Schmidt and Raoul Schubert and Philipp Cimiano},
journal= {arXiv preprint arXiv:2507.21257},
year = {2025}
}
备注
Research Track, 24th International Semantic Web Conference (ISWC 2025), November 2-6, 2025, Nara, Japan