哪些互信息表示学习目标对控制而言是充分的?
机器学习
2021-06-15 v1 人工智能
摘要
互信息最大化提供了一种引人注目的形式体系用于学习数据表示。在强化学习(RL)语境下,此类表示可通过丢弃无关与冗余信息、同时保留控制所需信息来加速学习。先前关于这些方法的工作大多解决了从高维观测样本中估计互信息的实际困难,而相对而言,从理论视角看哪些互信息目标能产生对 RL 充分的表示则理解较少。本文中,我们形式化了状态表示对于学习并表征最优策略的充分性,并透过此视角研究若干流行的基于互信息的目标。令人惊讶的是,我们发现其中两个目标在关于 MDP 结构的温和且常见假设下会产生不充分的表示。我们用一个具有视觉观测的模拟游戏环境中的实证实验佐证了我们的理论结果。
引用
@article{arxiv.2106.07278,
title = {Which Mutual-Information Representation Learning Objectives are Sufficient for Control?},
author = {Kate Rakelly and Abhishek Gupta and Carlos Florensa and Sergey Levine},
journal= {arXiv preprint arXiv:2106.07278},
year = {2021}
}
备注
18 pages, 11 figures