中文

压缩与控制

人工智能 2014-11-20 v1 信息论 math.IT

摘要

本文描述了一种用于强化学习的新信息论策略评估技术。该技术将任何压缩或密度模型转换为相应的价值估计。在适当的平稳性和遍历性条件下,我们表明使用足够强大的模型会产生一致的价值函数估计器。我们还研究了将该技术应用于各种 Atari 2600 视频游戏时的行为,在这种情况下,使用次优建模技术是不可避免的。我们考虑了三种根本不同的模型,它们都过于有限而无法完美地模拟系统动力学。值得注意的是,我们发现我们的技术提供了足够准确的价值估计,以实现有效的同策略控制。最后,我们通过一项启发性的研究结束了本文,突出了我们的技术扩展到大规模问题的潜力。

关键词

引用

@article{arxiv.1411.5326,
  title  = {Compress and Control},
  author = {Joel Veness and Marc G. Bellemare and Marcus Hutter and Alvin Chua and Guillaume Desjardins},
  journal= {arXiv preprint arXiv:1411.5326},
  year   = {2014}
}

备注

8 pages, 5 figures