中文

深度强化学习的随机先验函数

机器学习 2018-11-16 v2 人工智能 机器学习

摘要

处理不确定性对于高效的强化学习至关重要。关于从固定数据集进行深度学习不确定性估计的文献日益增多,但许多最流行的方法并不适用于序贯决策问题。其他方法(如 bootstrap 采样)对于并非来自观测数据的不确定性没有机制。我们强调这是一个关键缺陷,并通过对每个集成成员添加一个随机的不可训练的“先验”网络提出一种简单补救。我们证明该方法在线性表示下是高效的,以非线性表示下的简单示例展示其效能,并表明该方法在大规模问题上的扩展性远优于以往尝试。

关键词

引用

@article{arxiv.1806.03335,
  title  = {Randomized Prior Functions for Deep Reinforcement Learning},
  author = {Ian Osband and John Aslanides and Albin Cassirer},
  journal= {arXiv preprint arXiv:1806.03335},
  year   = {2018}
}