FORM:学习可表达且可迁移的一阶逻辑奖励机器
人工智能
2025-03-03 v3 形式语言与自动机理论
计算机科学中的逻辑
符号计算
摘要
奖励机器(Reward Machines, RMs)是解决强化学习(RL)中非马尔可夫奖励的有效方法,通过有限状态机实现。传统 RMs 由于以命题逻辑公式标记边缘,继承了命题逻辑的有限表达性。这一限制阻碍了 RMs 的可学习性和可迁移性,因为复杂任务需要大量状态和边。为克服这些挑战,我们提出了基于一阶逻辑的奖励机器(First-Order Reward Machines, ),通过一阶逻辑标记边缘,从而实现更紧凑且可迁移的 RMs。我们引入一种 novel 方法来学习 ,并提出一种多智能体方法来利用它们并促进其可迁移性,其中多个智能体协作学习针对共享 的策略。我们的实验结果表明, 在规模上优于传统 RMs。具体而言,我们展示了在传统 RMs 学习方法失败的任务中, 可以有效学习。我们还展示了多智能体学习框架和一阶语言提供的抽象,使得学习速度和任务可迁移性都有显著提升。
引用
@article{arxiv.2501.00364,
title = {FORM: Learning Expressive and Transferable First-Order Logic Reward Machines},
author = {Leo Ardon and Daniel Furelos-Blanco and Roko Parac and Alessandra Russo},
journal= {arXiv preprint arXiv:2501.00364},
year = {2025}
}
备注
AAMAS'25