通过张量分解学习良好的状态与动作表示
机器学习
2023-02-21 v2 机器学习
摘要
连续状态-动作马尔可夫决策过程(MDP)的转移核具有自然的张量结构。本文提出一种受张量启发的无监督学习方法,从经验轨迹中识别有意义的低维状态与动作表示。该方法通过核化、重要性采样和低 Tucker 秩近似来利用 MDP 的张量结构。该方法可进一步分别用于聚类状态和动作,并找到最佳的离散 MDP 抽象。我们给出了张量集中以及嵌入后扩散距离保持的精确统计误差界。我们进一步证明,所学的状态/动作抽象若潜在块结构存在,则能对其提供准确近似,从而支持策略评估等下游任务中的函数近似。
引用
@article{arxiv.2105.01136,
title = {Learning Good State and Action Representations via Tensor Decomposition},
author = {Chengzhuo Ni and Yaqi Duan and Munther Dahleh and Anru Zhang and Mengdi Wang},
journal= {arXiv preprint arXiv:2105.01136},
year = {2023}
}