时序差分学习的方差最小化方法
机器学习
2024-11-12 v1 人工智能
摘要
快速收敛算法是强化学习领域的当代需求。在线性函数逼近的背景下,关键矩阵最小特征值的大小是反映收敛速度的主要因素。传统基于价值的强化学习算法侧重于最小化误差。本文提出了一种方差最小化方法用于基于价值的强化学习,而非误差最小化。基于此方法,我们提出了两个目标——贝尔曼误差方差和投影贝尔曼误差方差,并推导了 VMTD、VMTDC 和 VMETD 算法。我们证明了它们的收敛性以及方差最小化对最优策略的不变性。实验研究验证了所提出算法的有效性。
引用
@article{arxiv.2411.06396,
title = {A Variance Minimization Approach to Temporal-Difference Learning},
author = {Xingguo Chen and Yu Gong and Shangdong Yang and Wenhao Wang},
journal= {arXiv preprint arXiv:2411.06396},
year = {2024}
}