从布尔到耦合奖励机器:面向长期无序任务的强化学习
人工智能
2025-11-03 v1
摘要
奖励机器(Reward Machines, RMs)为强化学习智能体提供环境奖励结构信息。这在处理复杂非马尔可夫任务时尤为有益,因为能够访问 RMs 的智能体可从更少样本中学习。然而,针对子任务可任意顺序执行的长期问题,学习使用 RMs 难以承担,因为子任务数量增加时,需学习的信息量呈指数级增长。本文通过引入 RMs 的三种通用扩展来克服此限制:(1)数值奖励机器(Numeric RMs)允许用户以紧凑形式表达复杂任务;(2)议程奖励机器(Agenda RMs)将状态与议程关联,议程跟踪剩余待完成子任务;(3)耦合奖励机器(Coupled RMs)将每个议程子任务关联的耦合状态。此外,我们引入一种新型组合学习算法,利用耦合 RMs 实现 Q-learning(CoRM)。我们的实验表明,CoRM 在无序子任务的长期问题上优于最先进的 RMs 算法在扩展性方面。
引用
@article{arxiv.2510.27329,
title = {Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines},
author = {Kristina Levina and Nikolaos Pappas and Athanasios Karapantelakis and Aneta Vulgarakis Feljan and Jendrik Seipp},
journal= {arXiv preprint arXiv:2510.27329},
year = {2025}
}