中文

结合可测任务表示学习的课程强化学习

机器学习 2026-05-25 v1 人工智能

摘要

在课程强化学习(CRL)中,智能体在一系列任务(即课程)上逐步积累知识,学习过程旨在利用积累的知识最终解决具有挑战性的目标任务。早期的 CRL 工作侧重于对候选任务进行排序,而最近的研究探索了自动课程生成。在丰富的 CRL 文献中,基于插值的 CRL 范式是主体,它通过在任务空间中使用有意义的距离度量(即可以衡量任务相似度)对初始任务分布和目标任务分布进行插值来自动生成中间任务。然而,在具有挑战性的导航任务中,非欧几里得的上下文(任务)空间使这一假设失效。为了在复杂任务中实现自动课程生成,我们提出了一种基于可测任务表示学习的新型自动课程生成方法。为了更好地衡量相似度,我们提议将任务空间转换到潜在空间。通过对奖励和状态转移进行编码的变分自编码器结构,我们实现了具有任务相似度度量属性的潜在任务表示,并且两个相近的任务嵌入对应于在奖励和状态转移方面相似的两个任务。基于学习到的任务表示,我们进一步开发了一种自动课程生成方案,该方案可以有效地生成越来越类似于目标任务的新任务。我们在各种具有挑战性的导航任务中评估了我们的方法,实验结果表明,所提出的方法超越了基于插值和生成对抗网络的最先进 CRL 方法。

关键词

引用

@article{arxiv.2605.23372,
  title  = {Curriculum reinforcement learning with measurable task representation learning},
  author = {Yongyan Wen and Siyuan Li and Mingjian Fu and Yiqin Yang and Xun Wang and Peng Liu},
  journal= {arXiv preprint arXiv:2605.23372},
  year   = {2026}
}