基于强化学习与监督微调的开源大语言模型教育知识优化
计算与语言
2026-04-09 v1
摘要
我们提出一种创新的多阶段优化策略,将强化学习(RL)和监督微调(SFT)相结合,以增强大型语言模型(LLMs)的教育知识,示例为EduQwen 32B-RL1、EduQwen 32B-SFT和可选的第三阶段模型EduQwen 32B-SFT-RL2:(1)实施渐进难度训练、聚焦挑战性示例并采用扩展推理 rollout的RL优化;(2)后续SFT阶段利用RL训练的模型合成高质量训练数据,采用难度加权抽样;(3)可选的第二轮RL优化。EduQwen 32B-RL1、EduQwen 32B-SFT和EduQwen 32B-SFT-RL2是基于稠密Qwen3-32B底层构建的面向应用的开源教育LLMs家族。这些模型在Cross-Domain Pedagogical Knowledge(CDPK)基准上取得了足够高的准确率,从而在交互式教学基准排行榜上建立了新的state-of-the-art(SOTA)结果,显著超过了规模更大的专有系统,如之前的基准领导者Gemini-3 Pro。这些稠密320亿参数模型证明,领域专业化优化可以将中等规模的开源LLMs转化为真正的教育领域专家,超越规模更大的通用系统,同时保持透明性、可定制性和成本效益,适用于负责任的教育AI部署。
引用
@article{arxiv.2604.06385,
title = {Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning},
author = {Navan Preet Singh and Xiaokun Wang and Anurag Garikipati and Madalina Ciobanu and Qingqing Mao and Ritankar Das},
journal= {arXiv preprint arXiv:2604.06385},
year = {2026}
}
备注
* These authors contributed equally to this work and share first authorship