基于生成重放的强化学习连续状态表示学习
机器学习
2018-12-12 v3 机器学习
摘要
我们考虑以连续方式构建状态表示模型的问题。随着环境变化,目标是在不丢失过去知识的情况下高效压缩感官状态的信息。学习到的特征随后被输入强化学习算法以学习策略。我们提议使用变分自编码器进行状态表示,并使用生成重放(即利用生成的样本)来维持过去知识。我们还提供了一种通用且统计上可靠的环境变化自动检测方法。我们的方法提供了高效的状态表示以及前向迁移,并避免了灾难性遗忘。所得模型能够在不使用过去数据且系统规模有界的情况下增量地学习信息。
引用
@article{arxiv.1810.03880,
title = {Continual State Representation Learning for Reinforcement Learning using Generative Replay},
author = {Hugo Caselles-Dupré and Michael Garcia-Ortiz and David Filliat},
journal= {arXiv preprint arXiv:1810.03880},
year = {2018}
}
备注
Accepted contribution to the Workshop on Continual Learning, NeurIPS 2018 (Neural Information Processing Systems)