中文

有限时段价值函数的张量低秩近似

机器学习 2024-05-29 v1 人工智能

摘要

强化学习的目标是估计将状态映射到动作的政策,并最大化马尔可夫决策过程(MDP)的累积奖励。这通常通过首先估计与每个状态-动作对相关的optimal(奖励)价值函数(VF)来实现。当MDP具有无限时限时,optimal VFs和政策在轻微条件下是平稳的。然而,在有限时限MDP中,VFS(因此为政策)会随时间变化。这构成了挑战,因为要估计的VFS数量不仅随状态-动作空间的大小而增长,也随时间范围而增长。本文提出了一种非参数低秩随机算法来近似估计有限时限MDP的VFS。首先,我们将(未知)VFS表示为多维数组或张量,其中时间是一个维度。然后,我们使用从MDP中抽样的奖励来估计optimal VFS。更准确地说,我们使用(truncated)PARAFAC分解来设计一种在线低秩算法,该算法恢复张量VFS条目的方法。低秩PARAFAC模型的规模随其各维度的规模而增加,这使我们的做法高效,正如通过数值实验所示。

关键词

引用

@article{arxiv.2405.17628,
  title  = {Tensor Low-rank Approximation of Finite-horizon Value Functions},
  author = {Sergio Rozada and Antonio G. Marques},
  journal= {arXiv preprint arXiv:2405.17628},
  year   = {2024}
}