奖励模型如何教学式思考:在教育中整合教学推理与思维奖励用于大语言模型
计算与语言
2026-01-22 v1
摘要
大语言模型越来越多地被部署为智能辅导系统,然而针对教育环境优化LLM的研究仍然有限。最近的工作提出了用于训练LLM辅导员的强化学习方法,但这些方法仅专注于优化可见响应,而忽略了模型的内部思维过程。我们引入了PedagogicalRL-Thinking,这是一个通过两种新颖方法将教学对齐扩展到教育中推理LLM的框架:(1)教学推理提示,它使用特定领域的教育理论而非通用指令来指导内部推理;以及(2)思维奖励,它明确评估和强化模型推理轨迹的教学质量。我们的实验表明,特定领域、基于理论的提示优于通用提示,并且思维奖励在与教学提示结合时最为有效。此外,仅在数学辅导对话上训练的模型在训练期间未见的教育基准测试中表现出改进的性能,同时保留了基础模型的事实知识。我们的定量和定性分析表明,教学思维奖励产生了系统的推理轨迹变化,在辅导员的思维过程中增加了教学推理和更结构化的教学决策制定。
引用
@article{arxiv.2601.14560,
title = {Rewarding How Models Think Pedagogically: Integrating Pedagogical Reasoning and Thinking Rewards for LLMs in Education},
author = {Unggi Lee and Jiyeong Bae and Jaehyeon Park and Haeun Park and Taejun Park and Younghoon Jeon and Sungmin Cho and Junbo Koh and Yeil Jeong and Gyeonggeon Lee},
journal= {arXiv preprint arXiv:2601.14560},
year = {2026}
}