中文

RuleReasoner: 基于域感知动态抽样的强化规则推理

计算与语言 2026-02-17 v2 人工智能 机器学习

摘要

规则推理被认为是推理的基本问题之一。虽然最近的研究表明,大型推理模型 (LRMs) 通过强化学习 (RL) 获得了显著的推理能力,但实际应用仍面临由于规则格式、类型和复杂度差异导致的严重挑战。为缓解这一问题,我们引入 RuleReasoner,一种通过广泛的精选任务集合和 novel domain-aware dynamic sampling 方法进行规则推理的有效方法。具体而言,RuleReasoner 通过更新基于历史奖励的 domain weights 来对每个训练 batch 进行重新抽样。这有助于 RL 的 domain balance 和 active learning 日程安排,无需人工设计的静态 mix-training。在 in-distribution (ID) 和 out-of-distribution (OOD) 基准测试上的评估显示,RuleReasoner 在八个 ID 任务上超过 OpenAI-o1 提高了 ΔΔ4.1%,在三个 OOD 任务上提高了 ΔΔ10.4%。值得注意的是,我们的方法还比先前方法具有更高的计算效率。

关键词

引用

@article{arxiv.2506.08672,
  title  = {RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling},
  author = {Yang Liu and Jiaqi Li and Zilong Zheng},
  journal= {arXiv preprint arXiv:2506.08672},
  year   = {2026}
}

备注

ICLR 2026 camera ready, 28 pages, 10 figures, 15 tables