中文

原型值网络:用辅助任务扩展表示学习

机器学习 2023-05-01 v1 人工智能 机器学习

摘要

辅助任务改善了深度强化学习智能体学到的表示。从解析上看,其影响已得到较好理解;然而在实践中,它们的主要用途仍是支撑主学习目标,而非作为学习表示的方法。考虑到许多辅助任务是程序化定义的,因此可被视为关于环境的近乎无限的信息源,这或许令人惊讶。基于该观察,我们研究辅助任务在学习丰富表示上的有效性,聚焦于任务数量与智能体网络规模同时增加的设定。为此,我们基于后继测度推导了一族新的辅助任务。这些任务易于实现且具备良好的理论性质。结合合适的离策学习规则,所得表示学习算法可理解为将Mahadevan & Maggioni (2007)的原型值函数扩展至深度强化学习——相应地,我们称所得对象为原型值网络。通过在Arcade Learning Environment上的一系列实验,我们证明原型值网络产生的丰富特征可用于获得与已有算法相当的性能,且仅使用线性逼近以及与环境变量奖励函数约4M次交互。

关键词

引用

@article{arxiv.2304.12567,
  title  = {Proto-Value Networks: Scaling Representation Learning with Auxiliary Tasks},
  author = {Jesse Farebrother and Joshua Greaves and Rishabh Agarwal and Charline Le Lan and Ross Goroshin and Pablo Samuel Castro and Marc G. Bellemare},
  journal= {arXiv preprint arXiv:2304.12567},
  year   = {2023}
}

备注

ICLR 2023. Code and models are available at https://github.com/google-research/google-research/tree/master/pvn 22 pages, 8 figures