基于符号奖励机器的强化学习
机器学习
2026-03-04 v1 人工智能
摘要
奖励机器(RMs)是强化学习(RL)中用于表示和学习稀疏、时序扩展任务的非马尔可夫奖励的已建立机制。RMs依赖于以标签形式出现的高层次信息,这些标签由环境在观察值同时发出。然而,这一概念需要针对每个环境和任务进行手动用户输入。用户必须创建计算标签的合适标注函数。这些限制导致其在广泛采用的RL框架中应用性较差。我们提出符号奖励机器(SRMs),并搭配学习算法 QSRM 和 LSRM 来克服RMs的局限性。SRMs仅消费环境的标准输出,并通过由符号公式表示的监护词(guards)直接处理观察值。在我们的评估中,我们的SRM方法优于基线RL方法,同时生成与现有RM方法相同的结果。与此同时,我们的方法遵循广泛使用环境定义,为用户提供可解释的任务表示。
引用
@article{arxiv.2603.03068,
title = {Reinforcement Learning with Symbolic Reward Machines},
author = {Thomas Krug and Daniel Neider},
journal= {arXiv preprint arXiv:2603.03068},
year = {2026}
}