终身非平稳环境下的深度强化学习
机器学习
2020-06-19 v1 人工智能
机器人学
机器学习
摘要
作为人类,我们的目标和环境在整个生命周期中会根据我们的经验、行动以及内部和外部驱动而持续变化。相比之下,典型的强化学习问题设定考虑的是在多个回合中平稳的决策过程。我们能否开发出能够应对前者(更现实的问题设定)中持续变化的强化学习算法?虽然策略梯度等 on-policy 算法原则上可以扩展到非平稳设定,但更高效的 off-policy 算法(在学习时重放过去经验)则无法如此。在这项工作中,我们形式化了这一问题设定,并借鉴在线学习和概率推断文献中的思想,推导出一种能够处理此类终身非平稳性的 off-policy 强化学习算法。我们的方法利用潜变量模型从当前和过去的经验中学习环境的表示,并基于该表示执行 off-policy 强化学习。我们进一步引入了若干展现终身非平稳性的仿真环境,并通过实证发现,我们的方法大幅优于那些不对环境偏移进行推断的方法。
引用
@article{arxiv.2006.10701,
title = {Deep Reinforcement Learning amidst Lifelong Non-Stationarity},
author = {Annie Xie and James Harrison and Chelsea Finn},
journal= {arXiv preprint arXiv:2006.10701},
year = {2020}
}
备注
supplementary website at https://sites.google.com/stanford.edu/lilac/