中文

数值奖赏机

人工智能 2024-05-01 v1 机器学习

摘要

奖赏机用于向强化学习智能体提供环境奖励结构信息,常常显著加速学习过程。然而,奖赏机仅接受布尔特征(如机器人到达金矿),因此许多本质上数值任务无法从奖赏机的指导中受益。为此,我们旨在扩展奖赏机,引入数值特征(如距离金矿的距离)。为此,我们提出了两种类型的奖赏机:数值-布尔型奖赏机和数值型奖赏机。在数值-布尔型奖赏机中,用两个布尔特征(距离金矿减小和机器人到达金矿)来模拟距离金矿的值。在数值型奖赏机中,直接使用距离金矿的数值特征。我们在Craft域中将新方法与基线奖赏机进行比较,其中数值特征为智能体到目标的距离。我们采用交叉积Q学习、带反事实经验的Q学习以及options框架进行学习。我们的实验结果表明,我们的新方法显著优于基线方法。将奖赏机扩展为数值特征开辟了在本质上数值任务中使用奖赏机的新可能性。

关键词

引用

@article{arxiv.2404.19370,
  title  = {Numeric Reward Machines},
  author = {Kristina Levina and Nikolaos Pappas and Athanasios Karapantelakis and Aneta Vulgarakis Feljan and Jendrik Seipp},
  journal= {arXiv preprint arXiv:2404.19370},
  year   = {2024}
}

备注

ICAPS 2024; Workshop on Bridging the Gap Between AI Planning and Reinforcement Learning