从问题解决到教学问题解决:使用强化学习将大语言模型对齐于教育学
计算与语言
2025-10-14 v2 人工智能
摘要
大语言模型(LLM)可以变革教育,但其针对直接问答的优化往往削弱了有效教学,这需要策略性地隐含答案。为此,我们提出一种基于在线强化学习(RL)的对齐框架,能够通过仿真的学生-教师互动快速适配大语言模型,使其成为有效的导师,强调教育质量和引导性问题解决,而非简单给出答案。我们的方法用于训练一个7B参数的导师模型,达到了与更大专有模型(如 LearnLM)相似的性能。我们引入可控的奖励加权,以平衡教育支持与学生解答准确性,使我们能够追踪这两个目标之间的帕累托前沿。我们的模型在保持推理能力方面优于单轮 SFT 基线,并且可以通过透露教学计划的思考标签来可选地增强可解释性。
引用
@article{arxiv.2505.15607,
title = {From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning},
author = {David Dinucu-Jianu and Jakub Macina and Nico Daheim and Ido Hakimi and Iryna Gurevych and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2505.15607},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main as an oral presentation. David Dinucu-Jianu and Jakub Macina contributed equally. Code available: https://github.com/eth-lre/PedagogicalRL