超越动作残差:通过瓶颈潜在强化学习实现真实世界机器人策略引导
机器人学
2026-05-20 v1
摘要
预训练的模仿策略已成为机器人操作的坚实基础,但它们通常需要在线改进以克服执行错误、有限的数据集覆盖和部署不匹配。因此,一个核心问题是强化学习(RL)应如何在离线预训练后适应策略。现有的轻量级方法通常在动作空间中直接应用残差校正,但这往往导致噪声大且结构不佳的探索。在这项工作中,我们提出了 Z-Perturbation 强化学习(ZPRL),一种通过紧凑的瓶颈潜在变量而非策略权重或输出动作来引导预训练策略的方法。在离线训练期间,我们用一个即插即用的变分信息瓶颈(VIB)模块增强策略,以从观测嵌入中提取与任务相关的潜在接口。在在线微调期间,基础策略被冻结,RL 仅学习该潜在变量上的一个残差扰动,其解码表示用于条件化冻结的动作生成器。我们在流匹配策略上实例化了 ZPRL,并在八个仿真任务和四个真实世界任务上对其进行了评估。在多样化的操作设置中,ZPRL 在样本效率和最终性能上均优于强大的后训练基线。在真实世界中,ZPRL 在四个任务上的平均成功率比模仿基础策略提高了 33.7%,同时产生了比动作残差方法更平滑的探索行为。这些结果表明,一个紧凑的、与任务对齐的瓶颈潜在变量为在线 RL 适应提供了一个有效的接口。更多视频可访问 https://manutdmoon.github.io/ZPRL/。
引用
@article{arxiv.2605.19919,
title = {Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning},
author = {Dongjie Yu and Kun Lei and Zhennan Jiang and Jia Pan and Huazhe Xu},
journal= {arXiv preprint arXiv:2605.19919},
year = {2026}
}