中文

基于 GRPO 的文本到 SPARQL 生成:来自 DBLP 的强化学习方法

计算与语言 2026-05-20 v1

摘要

知识图谱问答旨在将自然语言问题转化为知识图谱上的可执行查询,但现有方法往往依赖大型模型或以黄金查询注释形式的完全监督。本研究探讨了基于结果奖励的强化学习能否训练一个小型指令微调语言模型,在学术领域实现零样文本到 SPARQL 生成。在 DBLP-QuAD 上对 Qwen3-1.7B 模型应用组相对策略优化 (GRPO),使用结合自然语言问题和关于实体与关系的符号提示。训练依赖执行反馈、结构约束和答案级奖励,另外一种变体包含基于黄金查询的塑形。结果模型与未经修改的零样基线以及监督 DoRA 微调基线进行比较,评估指标包括答案级准确率、执行准确率、类别级得分以及对保留模板的泛化。GRPO 在零样基线上显著提升,并展现出具竞争力的泛化能力,而监督 DoRA 微调在相同模型规模下实现更高的整体准确率。消融分析表明,执行奖励 accounted for most gains,额外的塑形仅带来有限的额外收益,表明当缺乏用于 token 级监督的黄金查询时,基于结果的强化学习是一种可行的训练策略。

关键词

引用

@article{arxiv.2605.20066,
  title  = {Text-to-SPARQL Generation with Reinforcement Learning: A GRPO-based Approach on DBLP},
  author = {Jann Pfeifer and Debayan Banerjee and Ricardo Usbeck},
  journal= {arXiv preprint arXiv:2605.20066},
  year   = {2026}
}

备注

Accepted by NeSy 2026