基于状态抽象的近似探索
机器学习
2019-01-25 v2 人工智能
机器学习
摘要
尽管强化学习中的探索从理论角度已被充分理解,但可证明正确的方法仍不实用。本文研究探索与近似之间的相互作用,即我们所称的近似探索。我们的主要目标是深化对基于伪计数(pseudo-count)的探索奖励(Bellemare 等,2016)——一种基于密度建模的实用探索方案——的理论理解。作为热身,我们量化了将探索算法 MBIE-EB(Strehl 和 Littman,2008)与状态聚合显式结合时的性能。这使我们确认,正如可能预期的那样,近似使智能体能够在学习速度与所学策略质量之间进行权衡。接下来,我们展示给定密度模型如何与一种抽象相关联,并且相应的伪计数奖励可作为 MBIE-EB 结合该抽象时的替代项,但可能导致探索不足或过度探索。然后,我们表明给定密度模型还定义了一个隐式抽象,并发现由隐式或显式方式导出的伪计数之间存在令人惊讶的不匹配。最后我们推导出一种缓解该问题的新伪计数奖励。
引用
@article{arxiv.1808.09819,
title = {Approximate Exploration through State Abstraction},
author = {Adrien Ali Taïga and Aaron Courville and Marc G. Bellemare},
journal= {arXiv preprint arXiv:1808.09819},
year = {2019}
}