从非马尔可夫奖励过程推断概率奖励机用于强化学习
机器学习
2022-03-29 v2 形式语言与自动机理论
机器学习
摘要
强化学习在典型设置下的成功依赖于智能体借以学习最优策略的奖励信号的马尔可夫假设。近年来,奖励机的使用通过实现对非马尔可夫奖励的结构化表示放宽了该假设。特别地,此类表示可用于扩充底层决策过程的状态空间,从而促进非马尔可夫强化学习。然而,这些奖励机无法捕捉随机奖励信号的语义。本文在这一方向上取得进展,引入概率奖励机(PRMs)作为非马尔可夫随机奖励的表示。我们提出一种从底层决策过程学习 PRMs 的算法,并证明其正确性与收敛性相关结果。
引用
@article{arxiv.2107.04633,
title = {Inferring Probabilistic Reward Machines from Non-Markovian Reward Processes for Reinforcement Learning},
author = {Taylor Dohmen and Noah Topper and George Atia and Andre Beckus and Ashutosh Trivedi and Alvaro Velasquez},
journal= {arXiv preprint arXiv:2107.04633},
year = {2022}
}