基于指示器的 IB-GRPO:通过群相对政策优化实现 LLM 学习路径推荐与教育目标的对齐
人工智能
2026-01-22 v1 机器学习
摘要
学习路径推荐(LPR)旨在生成能够最大化长期学习效果,同时尊重教育原则和操作约束的个性化学习项目序列。尽管大语言模型(LLM)提供了免费格式推荐的丰富语义理解,但在实际应用中面临诸多挑战:(i)在稀疏、延迟反馈下与教育目标(如近似区(ZPD))对齐困难,(ii)专家示范稀缺且昂贵,(iii)学习效果、难度安排、长度可控性和轨迹多样性之间的多目标相互作用。为解决这些问题,我们提出了 IB-GRPO(Indicator-Based Group Relative Policy Optimization),一种基于指示器引导的 LLM 学习路径推荐对齐方法。为缓解数据稀缺,我们通过遗传算法搜索和教师 RL 代理构建混合专家示范,并通过监督微调热启动 LLM。基于此热启动,我们设计了一种会话内 ZPD 对齐评分用于难度安排。IB-GRPO 然后使用 支配指示器计算多个目标上的群相对优势,避免手动标量化并提高帕累托权衡。在 ASSIST09 和 Junyi 数据集上使用基于 Qwen2.5-7B 的 KES 模拟器进行实验,结果显示相对于代表性 RL 和 LLM 基线方法持续改进。
引用
@article{arxiv.2601.14686,
title = {IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization},
author = {Shuai Wang and Yaoming Yang and Bingdong Li and Hao Hao and Aimin Zhou},
journal= {arXiv preprint arXiv:2601.14686},
year = {2026}
}