UCO:基于大语言模型的多回合交互式强化学习方法用于自适应教学
人工智能
2026-01-06 v2
摘要
大语言模型(LLM)正从答案提供者转变为教育场景中的智能导师,但当前的监督微调方法仅学习表面教学模式,缺乏动态适应能力。近期的强化学习方法试图解决这一问题,但面临两个关键挑战:首先,仅依据学生是否产生正确输出来评估教学效果,无法区分学生是真正理解问题还是简单复述教师提供的答案;其次,无法通过交互式对话实时感知学生不断演化的认知状态,从而无法动态调整教学策略以匹配学生的认知水平。我们提出了单向认知优化(UCO)方法以解决上述挑战。UCO采用多回合交互式强化学习范式,其核心创新在于两个协同的奖励函数:进步奖励捕捉学生的认知发展,评估学生是否从困惑中转变为理解;支架奖励动态识别每个学生的近似发展区(ZPD),鼓励教师在该区域内进行富有成效的教学。我们在BigMath和MathTutorBench基准上对UCO进行评估。实验结果表明,我们的UCO模型在同等规模的所有模型中均取得优异表现,且性能与先进的闭源模型相当。代码和数据可在 https://github.com/Mind-Lab-ECNU/UCO 查阅。
引用
@article{arxiv.2511.08873,
title = {UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models},
author = {Shouang Wei and Min Zhang and Xin Lin and Bo Jiang and Kun Kuang and Zhongxiang Dai},
journal= {arXiv preprint arXiv:2511.08873},
year = {2026}
}