中文

面向累积回报最大化的课程学习

机器学习 2019-06-17 v1 人工智能 机器学习

摘要

课程学习已成功用于强化学习中,通过在不同复杂度的任务间进行知识迁移来加速学习过程。在必须尽量减少次优探索动作的关键任务中,课程学习及其通过迁移来塑造探索的能力可带来益处。我们提出一种最大化累积回报的任务排序算法,即智能体在所有学习回合中所获得回报的总和。通过最大化累积回报,智能体不仅旨在尽快获得高奖励,还旨在以限制次优动作的方式实现这一目标。我们在实验上将我们的任务排序算法与几种流行的组合优化元启发式算法进行比较,并表明其在累积回报最大化问题上取得了显著更好的性能。此外,我们在一个关键任务上验证了我们的算法,即优化微能源电网的家庭控制器。

关键词

引用

@article{arxiv.1906.06178,
  title  = {Curriculum Learning for Cumulative Return Maximization},
  author = {Francesco Foglino and Christiano Coletto Christakou and Ricardo Luna Gutierrez and Matteo Leonetti},
  journal= {arXiv preprint arXiv:1906.06178},
  year   = {2019}
}

备注

Proceedings of the 28th International Joint Conference on Artificial Intelligence (IJCAI-19). arXiv admin note: text overlap with arXiv:1901.11478