基于特征嵌入空间的离策略元强化学习方法
人工智能
2021-01-07 v1
摘要
元强化学习(RL)利用过往任务中获得的经验来解决新任务,从而应对深度 RL 中的样本低效问题。然而,大多数元 RL 方法需要部分或完全基于同策略的数据,即无法复用过往策略所收集的数据,这阻碍了样本效率的提升。为缓解该问题,我们提出一种新颖的离策略元 RL 方法——不确定性嵌入学习与评估(ELUE)。ELUE 智能体的特征在于学习各任务间共享的特征嵌入空间。它学习嵌入空间上的信念模型,以及信念条件策略与 Q 函数。随后,对于新任务,它通过预训练策略收集数据,并基于信念模型更新其信念。得益于信念更新,可用少量数据提升性能。此外,当数据充足时,它更新神经网络参数以调整预训练关系。我们通过在元 RL 基准上的实验证明,ELUE 优于最先进的元 RL 方法。
引用
@article{arxiv.2101.01883,
title = {Off-Policy Meta-Reinforcement Learning Based on Feature Embedding Spaces},
author = {Takahisa Imagawa and Takuya Hiraoka and Yoshimasa Tsuruoka},
journal= {arXiv preprint arXiv:2101.01883},
year = {2021}
}
备注
14pages