rSIM:通过强化策略注入激励LLM推理能力
人工智能
2025-12-10 v1
摘要
大型语言模型(LLM)通过强化学习(RL)进行后训练,以发展为推理语言模型(RLM),其典型特征是在链式思考(CoTs)中开始执行策略,如自我反思和深度思考。为此,本文提出一种新颖的强化策略注入机制(rSIM),使任何LLM都能通过小型规划器引导LLM的CoT,通过自适应注入推理策略来实现RLM。为实现此目标,规划器(领导智能体)与LLM(跟随智能体)基于多智能体强化学习(MARL)联合训练,基于领导-跟随框架和简单规则奖励。实验结果表明,rSIM使Qwen2.5-0.5B能够成为RLM,并显著优于Qwen2.5-14B。此外,规划器具有可 generalization性:只需训练一次即可作为插件应用于大幅提升现有LLM的推理能力。此外,规划器支持跨各种任务的持续学习,使其规划能力逐渐提高并泛化到更广泛的问题。
引用
@article{arxiv.2512.08300,
title = {rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection},
author = {Sijia Chen and Baochun Li and Di Niu},
journal= {arXiv preprint arXiv:2512.08300},
year = {2025}
}
备注
14 pages, 6 figures. Accepted to the ACL ARR July