中文

CRoSS:面向大规模强化学习的持续机器人仿真套件,具高任务多样性与真实物理仿真

机器学习 2026-02-05 v1 人工智能

摘要

持续强化学习(CRL)要求智能体在不忘记先前学习策略的前提下,从任务序列中学习。本文引入了一个基于Gazebo仿真器中真实机器人的CRL基准套件。我们的持续机器人仿真套件(CRoSS)基准依赖两个机器人平台:一个两轮差动驱动机器人,配备激光雷达、摄像头和 bumper 传感器;另一个拥有七个关节的机器人臂。前者用于直线跟随和物体推送场景,其中视觉和结构参数的变异产生大量不同的任务;后者用于两个目标到达场景,分别采用高层笛卡尔空间手臂位置控制(模仿Continual World基准)和低层关节角控制。对于机器人臂基准,我们提供额外的仅运动学变体,无需物理仿真(只要不需要传感器读数),可快两个数量级。CRoSS设计为可轻松扩展,使其能够在具高物理真实性的机器人环境中进行持续强化学习的受控研究,尤其允许使用几乎任意仿真传感器。为确保可重复性和易用性,我们提供了容器化 setup(Apptainer),开箱即用,并报告了标准强化学习算法(包括深度Q网络(DQN)和策略梯度方法)的性能。这些结果凸显了其作为可扩展且可重复的CRL研究基准的适用性。

关键词

引用

@article{arxiv.2602.04868,
  title  = {CRoSS: A Continual Robotic Simulation Suite for Scalable Reinforcement Learning with High Task Diversity and Realistic Physics Simulation},
  author = {Yannick Denker and Alexander Gepperth},
  journal= {arXiv preprint arXiv:2602.04868},
  year   = {2026}
}