价值驱动的后见建模
机器学习
2020-10-22 v2 机器学习
摘要
价值估计是强化学习(RL)范式的关键组成部分。如何有效地从数据中学习价值预测器是 RL 界研究的主要问题之一,不同方法以不同方式利用问题域中的结构。模型学习可利用观测序列中丰富的转移结构,但这种方法通常对奖励函数不敏感。相比之下,无模型方法直接利用来自未来的感兴趣量,但接收到的可能是微弱标量信号(回报的估计)。我们提出了一种介于这两种极端之间的 RL 表示学习方法:我们建议以能够直接助力价值预测的方式学习该建模什么。为此,我们确定未来轨迹的哪些特征可为预测相关回报提供有用信息。这提供了与任务直接相关且易于处理的预测目标,从而加速价值函数的学习。该思想可理解为在后见之明中推理未来观测的哪些方面有助于过去的价值预测。我们展示了即使在简单的策略评估设定中它也能带来显著帮助。随后我们在具有挑战性的大规模领域中测试了我们的方法,包括 57 款 Atari 2600 游戏。
引用
@article{arxiv.2002.08329,
title = {Value-driven Hindsight Modelling},
author = {Arthur Guez and Fabio Viola and Théophane Weber and Lars Buesing and Steven Kapturowski and Doina Precup and David Silver and Nicolas Heess},
journal= {arXiv preprint arXiv:2002.08329},
year = {2020}
}
备注
9 pages + reference + appendix. NeurIPS 2020 version