中文

基于基础模型的自动化奖励机器人:面向组合性强化学习的ARM-FM

人工智能 2026-03-10 v3 机器学习

摘要

强化学习(RL)算法对奖励函数的规格高度敏感,这仍是限制其广泛应用的核心挑战。我们提出了ARM-FM:Automated Reward Machines via Foundation Models,即利用基础模型(FMs)实现强化学习中自动、组合性奖励设计的框架。奖励机器人(RMs)——一种基于自动机的奖励规格 formalism——被用作RL目标规格的机制,并通过FMs的使用自动构建。RMs的结构化formalism产生有效的任务分解,而FMs的使用使目标规格能够以自然语言表示。具体而言,我们(i)使用FMs自动从自然语言规格生成RMs;(ii)将语言嵌入与每个RM自动机状态关联,以实现跨任务的泛化;(iii)提供在多样化具有挑战性环境中的ARM-FM有效性证据,包括零样本泛化证据。

关键词

引用

@article{arxiv.2510.14176,
  title  = {ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning},
  author = {Roger Creus Castanyer and Faisal Mohamed and Pablo Samuel Castro and Cyrus Neary and Glen Berseth},
  journal= {arXiv preprint arXiv:2510.14176},
  year   = {2026}
}

备注

Published at ICLR 2026