面向马尔可夫决策过程中统一策略抽象理论与表示学习方法的研究
机器学习
2022-09-19 v1 神经与进化计算
摘要
策略如何表示与优化是智能决策系统的核心根本问题。该问题的根源挑战在于策略空间的大规模与高复杂性,加剧了策略学习的难度,尤其在真实场景之中。为获得理想的代理策略空间,近期低维潜空间中的策略表示已展现出提升策略评估与优化的潜力。这些研究涉及的关键问题在于:应以何种准则抽象策略空间以实现所需的压缩与泛化。然而,关于策略抽象的理论与策略表示学习的方法在文献中均鲜有研究。本工作中,我们首次尝试填补这一空白。首先,我们提出统一的策略抽象理论,包含与不同层次策略特征相关的三类策略抽象。继而将其推广为量化策略距离(即相似性)的三种策略度量,以便在策略表示学习中更便捷地使用。进一步,我们提出一种基于深度度量学习的策略表示学习方法。在实证研究中,我们分别考察了所提策略度量与表示在刻画策略差异与传达策略泛化方面的效能。实验在策略优化与评估问题中进行,包含信赖域策略优化(TRPO)、多样性引导进化策略(DGES)与离策略评估(OPE)。结果自然表明,不存在对所有下游学习问题普遍最优的抽象;而影响-无关策略抽象可作为一般优选。
引用
@article{arxiv.2209.07696,
title = {Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes},
author = {Min Zhang and Hongyao Tang and Jianye Hao and Yan Zheng},
journal= {arXiv preprint arXiv:2209.07696},
year = {2022}
}
备注
Preprint version