中文

SpecRLBench:规格引导强化学习中的泛化基准

机器学习 2026-04-28 v1

摘要

规格引导的强化学习(RL)提供了一种使用线性时序逻辑(LTL)等形式化规格编码复杂、时序扩展任务的原则框架。虽然最近的方法显示出有前景的成果,但其在跨越未见规格和多样化环境的泛化能力仍不足以被充分理解。在本工作中,我们引入了 SpecRLBench,一个旨在评估 LTL 基于规格引导 RL 方法泛化能力的基准测试集。该基准测试跨越多个难度级别,覆盖导航和操控领域,集成静态与动态环境、多样化机器人动力学以及多种观察模态。通过大规模实证评估,我们刻画了现有方法的优势与局限,揭示了规格复杂度和环境复杂度增加时所遇到的挑战。SpecRLBench 提供了一个结构化平台,用于系统性比较,支持更具泛化能力的规格引导 RL 方法的开发。代码可在 https://github.com/BU-DEPEND-Lab/SpecRLBench 获取。

关键词

引用

@article{arxiv.2604.24729,
  title  = {SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning},
  author = {Zijian Guo and İlker Işık and H. M. Sabbir Ahmad and Wenchao Li},
  journal= {arXiv preprint arXiv:2604.24729},
  year   = {2026}
}