策略信息容量:深度强化学习中任务复杂度的信息论度量
机器学习
2021-06-01 v2 人工智能
机器学习
摘要
深度强化学习(RL)研究的进展很大程度上得益于基准任务环境。然而,对这些环境本质的分析常被忽视。特别是,我们仍没有公认的方法来衡量任务的难度或可解性,鉴于每个任务具有根本不同的动作、观测、动力学、奖励,且可用多样的 RL 算法解决。本工作中,我们提出策略信息容量(PIC)——策略参数与回合回报之间的互信息——以及策略最优信息容量(POIC)——策略参数与回合最优性之间的互信息——作为两个与环境无关、与算法无关的任务难度定量度量。我们在玩具环境以及来自 OpenAI Gym 和 DeepMind Control Suite 的连续控制基准任务上评估我们的度量,经验表明这些信息论度量与归一化任务可解性分数的相关性高于多种替代方案。最后,我们展示这些度量也可用于快速且计算高效地优化关键设计参数,如奖励塑形、策略架构和 MDP 属性,以在不运行完整 RL 实验的情况下获得更好的 RL 算法可解性。
引用
@article{arxiv.2103.12726,
title = {Policy Information Capacity: Information-Theoretic Measure for Task Complexity in Deep Reinforcement Learning},
author = {Hiroki Furuta and Tatsuya Matsushima and Tadashi Kozuno and Yutaka Matsuo and Sergey Levine and Ofir Nachum and Shixiang Shane Gu},
journal= {arXiv preprint arXiv:2103.12726},
year = {2021}
}
备注
Accepted to ICML2021. The code is available at: https://github.com/frt03/pic