强化学习中神经网络表示性质的研究
机器学习
2023-05-08 v3
摘要
本文研究深度强化学习系统所学表示的性质。早期关于强化学习表示的工作多聚焦于设计固定基架构以实现被认为可取的性质,如正交性与稀疏性。相反,深度强化学习方法的理念在于智能体设计者不应编码表示性质,而应由数据流决定表示的性质——良好的表示在恰当训练方案下自然涌现。本文将这两种视角结合,实证考察支撑强化学习中迁移的表示性质。我们在超过两万五千个智能体-任务设定上引入并度量了六种表示性质。我们考虑在基于像素的导航环境中具有不同辅助损失的 Deep Q-learning 智能体,其源任务与迁移任务对应于不同目标位置。我们开发了一种方法,通过系统改变任务相似度并度量表示性质与迁移性能的相关性,以更好理解为何某些表示更利于迁移。我们通过考察由 Rainbow 智能体学习的、能在 Atari 2600 游戏模式间成功迁移的表示,展示了该方法的通用性。
引用
@article{arxiv.2203.15955,
title = {Investigating the Properties of Neural Network Representations in Reinforcement Learning},
author = {Han Wang and Erfan Miahi and Martha White and Marlos C. Machado and Zaheer Abbas and Raksha Kumaraswamy and Vincent Liu and Adam White},
journal= {arXiv preprint arXiv:2203.15955},
year = {2023}
}