深度强化学习的随机先验函数
机器学习
2018-11-16 v2 人工智能
机器学习
摘要
处理不确定性对于高效的强化学习至关重要。关于从固定数据集进行深度学习不确定性估计的文献日益增多,但许多最流行的方法并不适用于序贯决策问题。其他方法(如 bootstrap 采样)对于并非来自观测数据的不确定性没有机制。我们强调这是一个关键缺陷,并通过对每个集成成员添加一个随机的不可训练的“先验”网络提出一种简单补救。我们证明该方法在线性表示下是高效的,以非线性表示下的简单示例展示其效能,并表明该方法在大规模问题上的扩展性远优于以往尝试。
引用
@article{arxiv.1806.03335,
title = {Randomized Prior Functions for Deep Reinforcement Learning},
author = {Ian Osband and John Aslanides and Albin Cassirer},
journal= {arXiv preprint arXiv:1806.03335},
year = {2018}
}