面向个性化元强化学习的策略散度表征
机器学习
2020-10-13 v1 人工智能
摘要
尽管少样本强化学习(RL)在昂贵探索和有限轨迹数据方面有着充分动机,但快速适应新环境仍是一项具有挑战性的任务,尤其在个性化设定下。此处,我们考虑向一组具有潜在不同特征的多个实体推荐最优策略的问题,使得各个实体可能参数化具有独特转移动力的不同环境。受元学习已有文献启发,我们拓展先前工作,聚焦于在个性化设定下某些环境彼此之间比其它环境更相似这一观念,并提出一种无模型元学习算法,在基于梯度的适应过程中按相关性优先利用过往经验。我们的算法通过逆强化学习方法表征过往策略散度,并阐明此类度量如何能有效依据部署环境区分过往策略参数,从而在测试时实现更有效的快速适应。为更有效地研究个性化,我们引入一个导航测试平台以专门纳入训练轮次间的环境多样性,并证明在个性化设定的少样本强化学习方面,我们的方法优于元学习替代方案。
引用
@article{arxiv.2010.04816,
title = {Characterizing Policy Divergence for Personalized Meta-Reinforcement Learning},
author = {Michael Zhang},
journal= {arXiv preprint arXiv:2010.04816},
year = {2020}
}
备注
Deep Reinforcement Learning Workshop, NeurIPS 2019; Workshop on Meta-Learning (Meta-Learn), NeurIPS 2019