PEARL:基于教育对齐强化学习训练索克拉托导师
机器学习
2026-05-29 v1 计算与语言
摘要
大型语言模型(LLM)已在教育导师方面显示出前景,但有效的教学不仅需要解答问题,还需提供渐进的苏格拉底式指导,并在多轮交互中平衡多个教育目标。然而,培训此类导师面临挑战,包括有限保真度和可控性较弱的学生模拟、教育奖励建模不完整以及多目标优化不稳定。为克服这些限制,我们提出了PEARL(Pedagogically Aligned Reinforcement Learning),一个用于训练索克拉托式教学代理人的教育对齐强化学习框架,包含三个关键组件。首先,我们引入可控学生模拟器,通过解耦潜在认知状态和响应生成来建模多样化的能力和误解。其次,我们开发了生成式奖励模型,联合评估教育质量和目标正确性以进行策略优化。最后,我们提出一种稳定的多目标RL方案,将每个维度的奖励离散化后聚合归一化优势,以防止高方差目标主导更新。在多个基准测试上实验表明,PEARL在开源模型中实现了最佳性能,尽管仅使用30B规模的策略模型,仍与领先的专有LLM保持竞争力。
引用
@article{arxiv.2605.29582,
title = {PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning},
author = {Qikai Chang and Zhenrong Zhang and Linbo Chen and Pengfei Hu and Jianshu Zhang and Youhui Guo and Jun Du},
journal= {arXiv preprint arXiv:2605.29582},
year = {2026}
}
备注
16 pages, 7 figures