MOTIF:通过强化微调实现大语言模型的模块化思考
计算与语言
2025-07-04 v1 人工智能
信息论
机器学习
系统与控制
系统与控制
math.IT
摘要
大型语言模型推理能力的最新进展表明,采用组相对策略优化算法进行强化学习训练,允许模型使用更多的思考/推理令牌来生成更好的响应。然而,语言模型在保持对先前生成令牌的注意力的同时,只能生成有限数量的令牌。这个限制,也称为语言模型的上下文大小,是语言模型处理任意大量令牌推理时的瓶颈。为了超越上下文大小的限制进行思考,语言模型必须采用模块化思考策略进行多轮推理。在这项工作中,我们提出了MOTIF:通过强化微调实现模块化思考——一种用于在多轮中生成思考令牌的强化学习训练方法,有效地允许模型利用额外的上下文大小进行思考。我们通过参数高效微调在GSM8K数据集上训练了开源模型Qwen2.5-3B-Instruct,并在MATH500和AIME2024基准测试上测试了其准确性。我们的实验表明,在相应基准测试上,相比基于原始GRPO的训练,分别有3.8%和3.3%的提升。此外,这一提升仅使用了15%的样本,从而展示了MOTIF的样本效率。我们的代码和模型分别可在https://github.com/purbeshmitra/MOTIF 和 https://huggingface.co/purbeshmitra/MOTIF 获取。
引用
@article{arxiv.2507.02851,
title = {MOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMs},
author = {Purbesh Mitra and Sennur Ulukus},
journal= {arXiv preprint arXiv:2507.02851},
year = {2025}
}