马尔可夫决策过程中的困难性:理论与实证
机器学习
2022-10-25 v1
摘要
细致分析强化学习方法在困难(具有挑战性)环境中的经验优势与弱点,对于启发创新和评估领域进展至关重要。在表格型强化学习中,尚无确立的标准环境选取来进行此类分析,这部分归因于缺乏对环境的丰富困难性理论的广泛理解。本文的目标是通过四项主要贡献释放该理论的实际效用。首先,我们呈现了困难性理论的系统性综述,并指出了有前景的研究方向。其次,我们引入了 Colosseum,一个开创性的软件包,支持经验困难性分析并实现了由相对于不同困难性度量具有多样性的环境构成的规范性基准。第三,我们给出了提供关于可计算度量的新洞见的经验分析。最后,我们在新提出的基准中对五个表格型智能体进行了基准测试。尽管推进非表格强化学习中困难性理论理解仍然必要,我们在表格设定下的贡献意在作为迈向规范性非表格基准的坚实步骤。相应地,我们在 Colosseum 环境的非表格版本中对四个智能体进行了基准测试,所得结果证明了表格困难性度量的通用性。
引用
@article{arxiv.2210.13075,
title = {Hardness in Markov Decision Processes: Theory and Practice},
author = {Michelangelo Conserva and Paulo Rauber},
journal= {arXiv preprint arXiv:2210.13075},
year = {2022}
}