强化学习中张量与矩阵低秩价值函数逼近
机器学习
2024-05-29 v3 人工智能
摘要
价值函数(VF)逼近是强化学习(RL)中的一个核心问题。经典的非参数VF估计面临维度灾难。因此,在高维空间中采用简约的参数模型来逼近VF,大部分努力集中在基于线性和神经网络的方法上。与此不同,本文提出一种简约的非参数方法,我们使用随机低秩算法以在线、无模型的方式估计VF矩阵。此外,由于VF往往是多维的,我们建议用张量(多维数组)表示替代经典的VF矩阵表示,然后使用PARAFAC分解设计一种在线无模型张量低秩算法。我们提出了该算法的不同版本,分析了其复杂度,并使用标准RL环境对其性能进行了数值评估。
引用
@article{arxiv.2201.09736,
title = {Tensor and Matrix Low-Rank Value-Function Approximation in Reinforcement Learning},
author = {Sergio Rozada and Santiago Paternain and Antonio G. Marques},
journal= {arXiv preprint arXiv:2201.09736},
year = {2024}
}
备注
13 pages, 6 figures, 2 table