一种面向非回合制强化学习的状态分布匹配方法
机器学习
2022-05-12 v1 人工智能
机器人学
摘要
尽管强化学习(RL)提供了一个通过试错进行学习的框架,但将 RL 算法应用到现实世界仍然充满挑战。现实应用的一个主要障碍在于算法在回合制(episodic)设定下的发展,即每轮试验后环境被重置,这与人类和机器人等具身智能体所遇到的持续且非回合制的现实世界性质截然不同。先前工作考虑了一种交替方法:前向策略学习解决任务,后向策略学习重置环境,但后向策略应将智能体重置到何种初始状态分布?在假设可获取少量演示的前提下,我们提出了一种新方法 MEDAL,训练后向策略以匹配所给演示中的状态分布。这使智能体保持在任务相关状态附近,并为前向策略提供难易混合的起始状态。我们的实验表明,在 EARL 基准的三个稀疏奖励连续控制任务上,MEDAL 匹配或优于先前方法,在最困难任务上取得 40% 的提升,同时比先前工作作出更少的假设。
引用
@article{arxiv.2205.05212,
title = {A State-Distribution Matching Approach to Non-Episodic Reinforcement Learning},
author = {Archit Sharma and Rehaan Ahmad and Chelsea Finn},
journal= {arXiv preprint arXiv:2205.05212},
year = {2022}
}