网格世界马尔可夫决策过程中的外推
机器学习
2020-04-16 v1 机器学习
摘要
强化学习中的外推是指在测试时给定训练时不可能出现的状态而具备泛化的能力。在此我们考虑在简单网格世界环境中导致外推改善的四个因素:(a)在测试时避免采用最大Q值(或其他确定性方法)进行动作选择,(b)网格世界的自我中心表示,(c)利用旋转与镜像不变卷积(而非标准平移不变卷积)将旋转和镜像对称性构建于学习机制中,以及(d)在损失函数中加入最大熵项以鼓励同等优的动作被等概率选择。
引用
@article{arxiv.2004.06784,
title = {Extrapolation in Gridworld Markov-Decision Processes},
author = {Eugene Charniak},
journal= {arXiv preprint arXiv:2004.06784},
year = {2020}
}