中文

Rulebook:将协程引入强化学习环境

编程语言 2025-04-29 v1 机器学习

摘要

由于依赖外部系统进行学习,强化学习(RL)算法需要具有非常简单接口的数字环境(如模拟器),从而显著限制了此类环境的实现。在特定方面,这些环境要么作为独立进程实现,要么作为状态机实现,导致前者存在同步和通信开销,而后者则导致编程结构松散。我们提出了一种新的领域特定的、基于协程的编译语言,名为Rulebook,旨在自动生成用于与机器学习(ML)算法及类似应用进行交互的状态机,且无需额外性能开销。Rulebook允许用户在无需关注ML组件所需的特定接口的情况下编写程序。通过将程序的执行模型与程序的语法编码相分离,从而无需手动状态管理,Rulebook允许以更低的开发成本创建更大规模和更复杂的环境。

关键词

引用

@article{arxiv.2504.19625,
  title  = {Rulebook: bringing co-routines to reinforcement learning environments},
  author = {Massimo Fioravanti and Samuele Pasini and Giovanni Agosta},
  journal= {arXiv preprint arXiv:2504.19625},
  year   = {2025}
}