神经蒸馏作为强化学习中的状态表示瓶颈
机器学习
2022-10-06 v1 人工智能
摘要
在强化学习中处理多任务时,学习良好的状态表示是一项关键技能,因为它允许任务之间的迁移和更好的泛化。然而,定义什么构成有用的表示远非简单,且迄今为止没有标准方法来找到这样的编码。在本文中,我们认为蒸馏——一种旨在用单个神经网络模仿一组给定策略的过程——可用于学习展现出有利特性的状态表示。在这方面,我们定义了三个衡量状态编码理想特征的准则:在输入空间中选择重要变量的能力、根据其对应最优动作高效分离状态的能力,以及状态编码在新任务上的鲁棒性。我们首先在一个基于标准倒立摆问题的玩具环境中评估这些准则并验证蒸馏对状态表示的贡献,然后将分析扩展到来自 Atari 和 Procgen 基准的更复杂的视觉任务。
引用
@article{arxiv.2210.02224,
title = {Neural Distillation as a State Representation Bottleneck in Reinforcement Learning},
author = {Valentin Guillet and Dennis G. Wilson and Carlos Aguilar-Melchor and Emmanuel Rachelson},
journal= {arXiv preprint arXiv:2210.02224},
year = {2022}
}
备注
Published at the 1st Conference on Lifelong Learning Agents (CoLLAs), 2022