线性函数逼近:求解经典强化学习挑战的计算高效方法
机器学习
2024-06-03 v1
摘要
基于神经网络的价值函数逼近构成了Trust Region Policy Optimization (TRPO) 和Proximal Policy Optimization (PPO)等主流基于策略的方法的核心。虽然在处理复杂环境时具有显著价值,但我们注意到在State和动作空间足够低的环境中,计算昂贵的神经网络架构对简单价值逼近方法的提升仅有限。我们实现了基于Natural Actor Critic算法的自然演员评论算法,其演员更新通过自然策略梯度完成。本文提出,结合线性函数逼近的自然策略梯度(NPG)方法可作为价值逼近的范式,可能在此类环境中超越TRPO和PPO在性能和速度上的表现。在强化学习基准任务Cart Pole和Acrobot上,我们观察到该算法在训练速度上远超复杂神经网络结构,且获得等价或更佳结果。这使我们得出结论,在传统和稀疏奖励低维问题中,应推荐采用结合线性函数逼近的NPG方法来取代TRPO和PPO。
引用
@article{arxiv.2405.20350,
title = {Linear Function Approximation as a Computationally Efficient Method to Solve Classical Reinforcement Learning Challenges},
author = {Hari Srikanth},
journal= {arXiv preprint arXiv:2405.20350},
year = {2024}
}