中文

自步学习的 probabilistic 解释及其在强化学习中的应用

机器学习 2021-09-03 v3

摘要

在机器学习中,课程的使用已展现出强大的经验潜力,可通过避免训练目标局部最优来改善从数据中学习。对于强化学习(RL),课程尤为有趣,因为底层优化由于探索-利用权衡而极易陷入局部最优。近来,若干用于 RL 课程自动生成的方法被证明可提升性能,同时相较人工设计课程需要更少的专家知识。然而,这些方法很少从理论视角被研究,阻碍了对其实质的更深入理解。本文中,我们提出一种具有清晰理论基础的 RL 自动课程生成方法。更确切地说,我们将著名的自步学习范式形式化为在训练任务上诱导一个分布,该分布在任务复杂度与匹配期望任务分布的目标之间进行权衡。实验表明,在该诱导分布上训练有助于在不同任务中跨越 RL 算法避免不良的局部最优,这些任务具有无信息奖励与严峻探索需求。

关键词

引用

@article{arxiv.2102.13176,
  title  = {A Probabilistic Interpretation of Self-Paced Learning with Applications to Reinforcement Learning},
  author = {Pascal Klink and Hany Abdulsamad and Boris Belousov and Carlo D'Eramo and Jan Peters and Joni Pajarinen},
  journal= {arXiv preprint arXiv:2102.13176},
  year   = {2021}
}