RuleReasoner: 基于域感知动态抽样的强化规则推理
计算与语言
2026-02-17 v2 人工智能
机器学习
摘要
规则推理被认为是推理的基本问题之一。虽然最近的研究表明,大型推理模型 (LRMs) 通过强化学习 (RL) 获得了显著的推理能力,但实际应用仍面临由于规则格式、类型和复杂度差异导致的严重挑战。为缓解这一问题,我们引入 RuleReasoner,一种通过广泛的精选任务集合和 novel domain-aware dynamic sampling 方法进行规则推理的有效方法。具体而言,RuleReasoner 通过更新基于历史奖励的 domain weights 来对每个训练 batch 进行重新抽样。这有助于 RL 的 domain balance 和 active learning 日程安排,无需人工设计的静态 mix-training。在 in-distribution (ID) 和 out-of-distribution (OOD) 基准测试上的评估显示,RuleReasoner 在八个 ID 任务上超过 OpenAI-o1 提高了 4.1%,在三个 OOD 任务上提高了 10.4%。值得注意的是,我们的方法还比先前方法具有更高的计算效率。
引用
@article{arxiv.2506.08672,
title = {RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling},
author = {Yang Liu and Jiaqi Li and Zilong Zheng},
journal= {arXiv preprint arXiv:2506.08672},
year = {2026}
}
备注
ICLR 2026 camera ready, 28 pages, 10 figures, 15 tables