中文

通过张量分解学习良好的状态与动作表示

机器学习 2023-02-21 v2 机器学习

摘要

连续状态-动作马尔可夫决策过程(MDP)的转移核具有自然的张量结构。本文提出一种受张量启发的无监督学习方法,从经验轨迹中识别有意义的低维状态与动作表示。该方法通过核化、重要性采样和低 Tucker 秩近似来利用 MDP 的张量结构。该方法可进一步分别用于聚类状态和动作,并找到最佳的离散 MDP 抽象。我们给出了张量集中以及嵌入后扩散距离保持的精确统计误差界。我们进一步证明,所学的状态/动作抽象若潜在块结构存在,则能对其提供准确近似,从而支持策略评估等下游任务中的函数近似。

关键词

引用

@article{arxiv.2105.01136,
  title  = {Learning Good State and Action Representations via Tensor Decomposition},
  author = {Chengzhuo Ni and Yaqi Duan and Munther Dahleh and Anru Zhang and Mengdi Wang},
  journal= {arXiv preprint arXiv:2105.01136},
  year   = {2023}
}