中文

有限训练任务下的元强化学习——一种密度估计方法

机器学习 2024-04-01 v2 人工智能

摘要

在元强化学习(meta RL)中,智能体从一组训练任务中学习如何快速解决从同一任务分布中抽取的新任务。最优元 RL 策略(即贝叶斯最优行为)定义良好,并保证相对于任务分布的期望奖励最优。我们在本工作中探索的问题是:需要多少训练任务才能以高概率保证近似最优行为。近期工作为无模型设置提供了首个此类 PAC 分析,其中从历史相关策略从训练任务中学习。在本工作中,我们提出一种不同方法:直接使用密度估计技术学习任务分布,然后在学到的任务分布上训练策略。我们表明该方法得到的界依赖于任务分布的维度。特别是在任务分布位于低维流形上的设置中,我们扩展分析以使用降维技术并利用此类结构,获得了比先前工作显著更好的界,后者严格依赖于状态和动作的数量。我们方法的关键在于核密度估计方法所隐含的正则化。我们进一步证明,当将该正则化“插入”最先进的 VariBAD 元 RL 算法时,其在实践中是有用的。

关键词

引用

@article{arxiv.2206.10716,
  title  = {Meta Reinforcement Learning with Finite Training Tasks -- a Density Estimation Approach},
  author = {Zohar Rimon and Aviv Tamar and Gilad Adler},
  journal= {arXiv preprint arXiv:2206.10716},
  year   = {2024}
}