中文

通用策略适应的元强化学习:在全任务最优比较器下的可证近似最优性

机器学习 2024-10-15 v1

摘要

元强化学习(Meta-RL)因其在数据效率和可泛化性方面能够提升强化学习(RL)算法而受到关注。在本文中,我们开发了一个用于元强化学习的双层优化框架(BO-MRL),用于学习任务特定策略适应的元先验,该框架在一次数据收集上实现多步策略优化。超越现有元强化学习分析,我们提供了任务分布上期望最优间隙的上界。该度量衡量了策略适应从所学习的元先验到任务特定最优解之间的距离,并量化了模型对该任务分布的可泛化性。我们经验性地验证了推导出的上界的正确性,并展示了所提出算法在基准测试中的卓越有效性。

关键词

引用

@article{arxiv.2410.09728,
  title  = {Meta-Reinforcement Learning with Universal Policy Adaptation: Provable Near-Optimality under All-task Optimum Comparator},
  author = {Siyuan Xu and Minghui Zhu},
  journal= {arXiv preprint arXiv:2410.09728},
  year   = {2024}
}