压缩与控制
人工智能
2014-11-20 v1 信息论
math.IT
摘要
本文描述了一种用于强化学习的新信息论策略评估技术。该技术将任何压缩或密度模型转换为相应的价值估计。在适当的平稳性和遍历性条件下,我们表明使用足够强大的模型会产生一致的价值函数估计器。我们还研究了将该技术应用于各种 Atari 2600 视频游戏时的行为,在这种情况下,使用次优建模技术是不可避免的。我们考虑了三种根本不同的模型,它们都过于有限而无法完美地模拟系统动力学。值得注意的是,我们发现我们的技术提供了足够准确的价值估计,以实现有效的同策略控制。最后,我们通过一项启发性的研究结束了本文,突出了我们的技术扩展到大规模问题的潜力。
引用
@article{arxiv.1411.5326,
title = {Compress and Control},
author = {Joel Veness and Marc G. Bellemare and Marcus Hutter and Alvin Chua and Guillaume Desjardins},
journal= {arXiv preprint arXiv:1411.5326},
year = {2014}
}
备注
8 pages, 5 figures