中文

SPARK:基于知识图谱的自我对弈带不对称奖励

人工智能 2026-05-08 v1

摘要

自我对弈强化学习在具有形式可验证结构的领域(如数学和编程)中表现出色,此时问题生成与奖励计算都可以基于显式规则进行 grounding。将这一范式扩展到科学文献更具挑战性:多模态元素在文档内部及跨文档之间的关系在文本中很少显式化,这使得自动生成关系推理问题困难,削弱了奖励信号的可靠性。我们提出SPARK(Self-Play with Asymmetric Reward from Knowledge Graphs,基于知识图谱的自我对弈带不对称奖励),一个自动从多文档科学文献构建统一知识图谱(KG)并将其作为自我对弈结构基础的框架。KG中包含多模态节点的路径作为生成关系推理问题的来源,存储在KG中的结构事实提供可验证奖励计算的依据。在信息不对称的情况下,一个小型视觉语言模型(sVLM)在提议人和解答人角色之间交替工作,这一设计我们认为可以自然地向未来的在线自适应扩展。我们在公开基准测试和一个自构建的跨文档多跳问答数据集上评估了SPARK。结果表明,SPARK consistently优于基于平面语料库的自我对弈基线方法,随着跳跃次数的增加,性能差距也随之扩大,这表明KG结构对关系多跳推理的贡献超出了无结构语料库 grounding 所能提供的。

关键词

引用

@article{arxiv.2605.05546,
  title  = {SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs},
  author = {Hyobin Park and Taeseop Kim and Dong-Geol Choi},
  journal= {arXiv preprint arXiv:2605.05546},
  year   = {2026}
}