中文

程序机策略:通过集成程序合成与状态机解决长视野任务

机器学习 2024-02-12 v2 人工智能 编程语言 机器人学

摘要

深度强化学习(deep RL)在多个领域表现出色,但缺乏泛化性与可解释性。另一方面,程序化 RL 方法(Trivedi 等,2021;Liu 等,2023)将 RL 任务重新表述为合成可在环境中执行的可解释程序。尽管结果令人鼓舞,这些方法仅限于短视野任务。另一方面,使用状态机表示 RL 策略(Inala 等,2020)可归纳泛化至长视野任务;然而,其难以扩展以获取多样且复杂的行为。本工作提出程序机策略(POMP),桥接了程序化 RL 与状态机策略的优势,能够表示复杂行为并处理长期任务。具体而言,我们引入一种可检索一组有效、多样且兼容程序的方法。随后,我们将这些程序用作状态机的模态,并学习一个转移函数以在模态程序间转移,从而捕捉重复行为。我们提出的框架在各任务上优于程序化 RL 与 deep RL 基线,并展现出无需任何微调即可归纳泛化至更长视野的能力。消融研究证明了我们提出的用于检索一组程序作为模态的搜索算法的有效性。

关键词

引用

@article{arxiv.2311.15960,
  title  = {Program Machine Policy: Addressing Long-Horizon Tasks by Integrating Program Synthesis and State Machines},
  author = {Yu-An Lin and Chen-Tao Lee and Guan-Ting Liu and Pu-Jen Cheng and Shao-Hua Sun},
  journal= {arXiv preprint arXiv:2311.15960},
  year   = {2024}
}