面向长时序多目标强化学习的最大熵增益探索
机器学习
2020-07-07 v1 人工智能
机器人学
机器学习
摘要
在多目标强化学习中,智能体于训练期间在长时序任务里应追求何种目标?当期望的(测试时)目标分布过于遥远而无法提供有用的学习信号时,我们认为智能体不应追求不可达成的目标。相反,它应设定自身的内在目标,以最大化历史已达成目标分布的熵。我们提出通过让智能体在目标空间中稀疏探索区域追求过往已达成目标来优化该目标,从而将探索聚焦于可达成目标集的前沿。我们表明,在包括迷宫导航与积木堆叠的长时序多目标任务上,我们的策略比先前最优方法的样本效率提高了一个数量级。
引用
@article{arxiv.2007.02832,
title = {Maximum Entropy Gain Exploration for Long Horizon Multi-goal Reinforcement Learning},
author = {Silviu Pitis and Harris Chan and Stephen Zhao and Bradly Stadie and Jimmy Ba},
journal= {arXiv preprint arXiv:2007.02832},
year = {2020}
}
备注
12 pages (+12 appendix). Published as a conference paper at ICML 2020. Code available at https://github.com/spitis/mrl