中文

超越马尔可夫决策过程的同态性能保证

机器学习 2018-11-12 v1 机器学习

摘要

大多数现实世界问题具有巨大的状态和/或动作空间。因此,在此类问题上直接应用现有的表格解法不可行。然而,若智能体能够访问真实环境一个相对较小的状态-动作空间同态,且该映射能保证近最优性能,这些解法便十分有用。大量研究聚焦于同态为底层过程的马尔可夫表示的情形。然而,我们证明即便同态是非马尔可夫的,近最优性能有时也能得到保证。此外,通过放宽马尔可夫要求,我们可以在不牺牲性能的前提下聚合显著更多的状态。本工作中,我们将极端状态聚合(Extreme State Aggregation, ESA)框架扩展到联合状态-动作聚合。我们还取消了 ESA 中聚合的策略一致性条件,从而允许对真实环境进行更粗粒度的建模。

关键词

引用

@article{arxiv.1811.03895,
  title  = {Performance Guarantees for Homomorphisms Beyond Markov Decision Processes},
  author = {Sultan Javed Majeed and Marcus Hutter},
  journal= {arXiv preprint arXiv:1811.03895},
  year   = {2018}
}