从不完美演示与演化奖励中进行层次化学徒学习
机器学习
2026-04-02 v1 人工智能
摘要
虽然学徒学习已显示出从e-learning环境中的学生交互直接诱导有效教学策略的前景,但大多数现有方法依赖于固定奖励下的最优或近最优专家演示。然而,现实中的学生交互本质上往往是不完美且不断演化的:学生进行探索、犯错误、修正策略,并随着理解的深入而优化其目标。在本工作中,我们认为不完美的学生演示并非需要丢弃的噪声,而是结构化的信号——前提是它们的相对质量被排序。我们提出HALIDE——从不完美演示与演化奖励中进行层次化学徒学习,它不仅利用次优学生演示,还在层次学习框架内对它们进行排序。HALIDE在多个抽象层次上建模学生行为,使其能够从次优动作中推断更高层次的目标和策略,同时明确捕捉学生奖励函数的时间演化。通过将演示质量融入层次奖励推断,HALIDE区分了瞬时错误、次优策略以及向更高层次学习目标的有意义进展。我们的结果表明,HALIDE比依赖最优轨迹、固定奖励或未排序的不完美演示的方法更准确地预测学生的教学决策。
引用
@article{arxiv.2604.00258,
title = {Hierarchical Apprenticeship Learning from Imperfect Demonstrations with Evolving Rewards},
author = {Md Mirajul Islam and Rajesh Debnath and Adittya Soukarjya Saha and Min Chi},
journal= {arXiv preprint arXiv:2604.00258},
year = {2026}
}
备注
AIED 2026