MetaCURE:基于赋能驱动探索的元强化学习
人工智能
2021-11-15 v5 机器学习
摘要
元强化学习(meta-RL)从先前任务中提取知识,并对新任务实现快速适应。尽管近期取得了进展,元强化学习中的高效探索在稀疏奖励任务中仍是一个关键挑战,因为这需要在元训练和适应阶段快速找到信息丰富且与任务相关的经验。为应对该挑战,我们显式地对元强化学习的探索策略学习问题进行建模,将其与利用策略学习分离,并引入一种新颖的赋能驱动探索目标,旨在最大化任务识别的信息增益。我们推导了相应的内在奖励,并开发了一种新的离策略元强化学习框架,该框架通过共享任务推断知识高效学习分离的上下文感知探索与利用策略。实验评估表明,我们的元强化学习方法在各种稀疏奖励 MuJoCo 运动任务和更复杂的稀疏奖励 Meta-World 任务上显著优于最先进的基线。
引用
@article{arxiv.2006.08170,
title = {MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration},
author = {Jin Zhang and Jianhao Wang and Hao Hu and Tong Chen and Yingfeng Chen and Changjie Fan and Chongjie Zhang},
journal= {arXiv preprint arXiv:2006.08170},
year = {2021}
}