基于关键度的变步数强化学习算法
机器学习
2022-01-14 v1 人工智能
摘要
在强化学习背景下,我们引入状态关键度(criticality)的概念,其指示了该特定状态下动作选择对期望回报的影响程度。即,动作选择更可能影响最终结果的状态被认为比不太可能影响最终结果的状态更具关键度。我们 formulate 了一种基于关键度的变步数算法(CVS)——一种利用由人类提供或直接从环境学习得到的关键度函数的灵活步数算法。我们在三个不同领域(包括 Atari Pong 环境、Road-Tree 环境和 Shooter 环境)中测试了它。我们证明 CVS 能够优于 Deep Q-Learning 和 Monte Carlo 等流行学习算法。
引用
@article{arxiv.2201.05034,
title = {Criticality-Based Varying Step-Number Algorithm for Reinforcement Learning},
author = {Yitzhak Spielberg and Amos Azaria},
journal= {arXiv preprint arXiv:2201.05034},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:1810.07254