分析深度策略网络的隐藏激活:表征为何重要
机器学习
2021-03-12 v1
摘要
我们分析了深度强化学习(RL)智能体神经网络策略的隐藏激活,并从经验上表明,可以先验地知道一种状态表征是否有利于快速学习。处于高维状态中的 RL 智能体有两个主要学习负担:(1)学习动作选择策略;(2)学习辨别给定状态中有用与无用的信息。通过使用辅助模型学习这些高维状态的潜在表征,后一负担被有效消除,从而带来加速的训练进展。我们在 PyBullet Kuka 环境中跨任务考察了这一现象,其中智能体必须学习控制机械夹爪来拾取物体。我们的分析揭示了神经网络策略如何在整个训练过程中组织其对状态空间的内部表征。该分析的结果提供了关于深度 RL 智能体如何学习的三个主要见解。首先,策略网络内良好组织的内部表征是学习良好动作选择的先决条件。其次,糟糕的初始表征可导致策略网络内不可恢复的崩溃。第三,良好的初始表征允许智能体的策略网络在任何训练开始之前就组织其内部表征。
引用
@article{arxiv.2103.06398,
title = {Analyzing the Hidden Activations of Deep Policy Networks: Why Representation Matters},
author = {Trevor A. McInroe and Michael Spurrier and Jennifer Sieber and Stephen Conneely},
journal= {arXiv preprint arXiv:2103.06398},
year = {2021}
}
备注
11 pages, 29 figures