中文

TEACH:面向强化学习的时间方差驱动课程

机器学习 2025-12-30 v1

摘要

强化学习(RL)在解决单目标任务方面取得了显著成功。然而,在智能体必须学习通用目标条件策略的多目标环境中,均匀的目标选择通常会导致样本效率低下。受生物系统中观察到的自适应和结构化学习过程的启发,我们提出了一种新颖的师生学习范式,结合时间方差驱动课程来加速目标条件强化学习。在该框架中,教师模块动态地优先处理策略置信度得分中具有最高时间方差的目标,该得分由状态-动作价值(Q)函数参数化。教师通过针对这些高不确定性目标提供自适应且集中的学习信号,促进持续且高效的进展。我们建立了 Q 值的时间方差与策略演化之间的理论联系,为该方法的底层原理提供了见解。我们的方法与算法无关,可与现有的 RL 框架无缝集成。我们通过在 11 项多样化的机器人操作和迷宫导航任务上进行评估来证明这一点。结果表明,与最先进的课程学习和目标选择方法相比,该方法取得了持续且显著的改进。

关键词

引用

@article{arxiv.2512.22824,
  title  = {TEACH: Temporal Variance-Driven Curriculum for Reinforcement Learning},
  author = {Gaurav Chaudhary and Laxmidhar Behera},
  journal= {arXiv preprint arXiv:2512.22824},
  year   = {2025}
}