中文

FORM:学习可表达且可迁移的一阶逻辑奖励机器

人工智能 2025-03-03 v3 形式语言与自动机理论 计算机科学中的逻辑 符号计算

摘要

奖励机器(Reward Machines, RMs)是解决强化学习(RL)中非马尔可夫奖励的有效方法,通过有限状态机实现。传统 RMs 由于以命题逻辑公式标记边缘,继承了命题逻辑的有限表达性。这一限制阻碍了 RMs 的可学习性和可迁移性,因为复杂任务需要大量状态和边。为克服这些挑战,我们提出了基于一阶逻辑的奖励机器(First-Order Reward Machines, FORM\texttt{FORM}),通过一阶逻辑标记边缘,从而实现更紧凑且可迁移的 RMs。我们引入一种 novel 方法来学习 FORM\texttt{FORM},并提出一种多智能体方法来利用它们并促进其可迁移性,其中多个智能体协作学习针对共享 FORM\texttt{FORM} 的策略。我们的实验结果表明,FORM\texttt{FORM} 在规模上优于传统 RMs。具体而言,我们展示了在传统 RMs 学习方法失败的任务中,FORM\texttt{FORM} 可以有效学习。我们还展示了多智能体学习框架和一阶语言提供的抽象,使得学习速度和任务可迁移性都有显著提升。

关键词

引用

@article{arxiv.2501.00364,
  title  = {FORM: Learning Expressive and Transferable First-Order Logic Reward Machines},
  author = {Leo Ardon and Daniel Furelos-Blanco and Roko Parac and Alessandra Russo},
  journal= {arXiv preprint arXiv:2501.00364},
  year   = {2025}
}

备注

AAMAS'25