中文

非马尔可夫性在最大状态熵探索中的重要性

机器学习 2022-07-11 v2

摘要

在最大状态熵探索框架中,智能体在无奖励环境中交互以学习一种策略,使其诱导的期望状态访问熵最大化。Hazan 等人(2019)指出,马尔可夫随机策略类对于最大状态熵目标已足够,且在此设定下利用非马尔可夫性通常被认为毫无意义。在本文中,我们论证在有限样本机制下,非马尔可夫性对于最大状态熵探索反而是至关重要的。特别地,我们重新表述目标,以针对单次试验中诱导状态访问的期望熵。进而,我们表明非马尔可夫确定性策略类对于所引入的目标是充分的,而马尔可夫策略在一般情况下承受非零遗憾。然而,我们证明寻找最优非马尔可夫策略的问题是 NP-hard 的。尽管有此负面结果,我们讨论了以可处理方式解决问题的途径,以及非马尔可夫探索如何在未来工作中有益于在线强化学习的样本效率。

关键词

引用

@article{arxiv.2202.03060,
  title  = {The Importance of Non-Markovianity in Maximum State Entropy Exploration},
  author = {Mirco Mutti and Riccardo De Santi and Marcello Restelli},
  journal= {arXiv preprint arXiv:2202.03060},
  year   = {2022}
}

备注

ICML 2022