用于建模异构学生教学策略的通用学习框架
机器学习
2024-06-05 v1 人工智能
摘要
智能教学系统 (ITS) 等电子学习环境中的一个关键挑战是高效诱导有效的教学策略。虽然深度强化学习 (DRL) 常因样本效率低和奖励函数设计困难而受限,但学习 (AL) 算法可以克服这些问题。然而,大多数 AL 算法无法处理异构性,因为它们假设所有演示都是由单一奖励函数驱动的均匀策略生成。一些考虑异构性的 AL 算法也无法泛化到大型连续状态空间,仅适用于离散状态。在本文中,我们提出了一种期望-最大化 (EM)-EDM 框架,用于从给定的 optimal 或接近 optimal 的演示中诱导有效的教学策略,假设这些演示由异构奖励函数驱动。我们将 EM-EDM 诱导的策略与四种 AL 基线和两种 DRL 策略进行比较,分别用于涉及教学动作预测的两个不同但相关的任务。我们的总体结果显示,在两个任务中,EM-EDM 在所有性能指标上均优于四个 AL 基线和两个 DRL 基线。这表明 EM-EDM 能够通过管理大型连续状态空间和适应处理来自少量演示的多样化和异构奖励函数,从而有效地建模复杂的学生教学决策过程。
引用
@article{arxiv.2406.02450,
title = {A Generalized Apprenticeship Learning Framework for Modeling Heterogeneous Student Pedagogical Strategies},
author = {Md Mirajul Islam and Xi Yang and John Hostetter and Adittya Soukarjya Saha and Min Chi},
journal= {arXiv preprint arXiv:2406.02450},
year = {2024}
}