中文

Temp-R1:基于逆向课程强化学习的复杂时序知识图谱问答统一自主智能体

计算与语言 2026-04-22 v2 人工智能 机器学习

摘要

时序知识图谱问答(TKGQA)本质上具有挑战性,因为它需要对具有多跳依赖关系和复杂时序约束的动态事实进行复杂推理。现有方法依赖固定的工作流和昂贵的闭源 API,限制了灵活性和可扩展性。我们提出了 Temp-R1,这是首个通过强化学习训练的用于 TKGQA 的端到端自主智能体。为了解决单动作推理中的认知过载问题,我们在外部动作之外扩展了包含专用内部动作的动作空间。为了防止在简单问题上的捷径学习,我们引入了逆向课程学习,先在困难问题上进行训练,迫使模型在迁移到更简单案例之前发展出复杂的推理能力。我们的 80 亿参数 Temp-R1 在 MultiTQ 和 TimelineKGQA 上实现了 SOTA 性能,在复杂问题上比强基线提升了 19.8%。我们的工作为自主时序推理智能体确立了新范式。代码可在 https://github.com/zjukg/Temp-R1 获取。

关键词

引用

@article{arxiv.2601.18296,
  title  = {Temp-R1: A Unified Autonomous Agent for Complex Temporal KGQA via Reverse Curriculum Reinforcement Learning},
  author = {Zhaoyan Gong and Zhiqiang Liu and Songze Li and Xiaoke Guo and Yuanxiang Liu and Xinle Deng and Zhizhen Liu and Lei Liang and Huajun Chen and Wen Zhang},
  journal= {arXiv preprint arXiv:2601.18296},
  year   = {2026}
}

备注

ACL 2026 main