KnowRL: 通过最小充分知识引导进行强化学习以提升 LLM 推理能力
人工智能
2026-04-15 v1
摘要
RLVR 改善大型语言模型的推理能力, 但常因困难问题上的奖励稀疏而受限。最近的基于线索的 RL 方法通过注入部分解决方案或抽象模板来缓解稀疏性, 但通常通过增加标记来扩展引导, 这会引入冗余、不一致以及额外的训练开销。我们提出 KnowRL (知识引导强化学习), 这一 RL 训练框架将线索设计视为最小充分引导问题。在 RL 训练期间, KnowRL 将引导分解为原子知识点 (KPs), 并使用受限子集搜索 (CSS) 构建紧凑且感知交互的子集用于训练。我们进一步识别了一种修剪交互悖论 — — 删除一个 KPs 可能有助于, 但删除多个此类 KPs 可能适得其反 — — 并在该依赖结构下显式优化以进行稳健的子集精选。我们训练 KnowRL-Nemotron-1.5B 来自 OpenMath-Nemotron-1.5B。在规模为 1.5B 的八个推理基准测试中, KnowRL-Nemotron-1.5B 持续优于强大的 RL 和线索基线方法。无需 KPs 线索推理时, KnowRL-Nemotron-1.5B 的平均准确率达到 70.08, 已超过 Nemotron-1.5B 高出 +9.63 分; 采用选定 KPs 后, 性能提升至 74.16, 在该规模下建立了新的研究成果。该模型、精选训练数据以及代码均公开于 https://github.com/Hasuer/KnowRL。
引用
@article{arxiv.2604.12627,
title = {KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance},
author = {Linhao Yu and Tianmeng Yang and Siyu Ding and Renren Jin and Naibin Gu and Xiangzhao Hao and Shuaiyi Nie and Deyi Xiong and Weichong Yin and Yu Sun and Hua Wu},
journal= {arXiv preprint arXiv:2604.12627},
year = {2026}
}