中文

基于次优干预的真实世界强化学习

机器人学 2026-01-01 v1

摘要

真实世界强化学习(Reinforcement Learning, RL)为在线训练精确且灵巧的机器人操作策略提供了一种有前景的方法,使机器人能够从自身经验中学习,同时逐步减少人工劳动。然而,先前的真实世界RL方法通常假设人类干预在整个状态空间上都是最优的,忽略了即使是专家操作员也无法在所有状态下始终提供最优动作或完全避免错误的事实。不加区分地将干预数据与机器人收集的数据混合,会继承RL的样本低效性,而纯粹模仿干预数据则可能最终降低RL所能达到的最终性能。因此,如何利用可能次优且带噪声的人类干预来加速学习而不受其限制,仍然是一个悬而未决的问题。为应对这一挑战,我们提出了 SiLRI,一种用于真实世界机器人操作任务的状态依赖拉格朗日强化学习算法。具体而言,我们将在线操作问题形式化为一个约束 RL 优化问题,其中每个状态下的约束边界由人类干预的不确定性决定。然后,我们引入一个状态依赖的拉格朗日乘子,并通过最小-最大优化来求解该问题,联合优化策略和拉格朗日乘子以达到鞍点。基于一个人类作为副驾驶的遥操作系统,我们的算法在多种操作任务上通过真实世界实验进行了评估。实验结果表明,SiLRI 有效利用了人类的次优干预,与最先进的 RL 方法 HIL-SERL 相比,达到 90% 成功率所需的时间至少减少了 50%,并在其他 RL 方法难以成功的长时间操作任务上实现了 100% 的成功率。项目网站:https://silri-rl.github.io/。

关键词

引用

@article{arxiv.2512.24288,
  title  = {Real-world Reinforcement Learning from Suboptimal Interventions},
  author = {Yinuo Zhao and Huiqian Jin and Lechun Jiang and Xinyi Zhang and Kun Wu and Pei Ren and Zhiyuan Xu and Zhengping Che and Lei Sun and Dapeng Wu and Chi Harold Liu and Jian Tang},
  journal= {arXiv preprint arXiv:2512.24288},
  year   = {2026}
}