基于随机解耦策略梯度的高效单步视觉强化学习
机器人学
2026-05-27 v1 人工智能
计算机视觉与模式识别
机器学习
系统与控制
系统与控制
摘要
我们提出了随机解耦策略梯度 (SDPG),这是一种轻量级的视觉强化学习 (RL) 方法,能够在数小时内在单块 NVIDIA RTX 4080 GPU 上端到端训练出多样化的视觉运动控制策略。SDPG 通过对轨迹滚动进行随机扰动来估计策略梯度,所需的批量渲染环境数量远低于传统方法,显著降低了计算和内存开销。在视觉 MuJoCo 基准测试中,SDPG 在训练时间、内存使用和奖励方面均一致优于基线方法。最后,为了支持后续研究,我们引入了一套现实感知的视觉机器人基准测试,涵盖灵巧操控、具挑战性的 locomotion 任务,并演示了在物理硬件上的有效仿真到现实迁移。
引用
@article{arxiv.2605.26478,
title = {Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient},
author = {Haoxiang You and Yilang Liu and Davis Zong and Qian Wang and Teeratham Vitchutripop and Qi Wang and Daniel Rakita and Ian Abraham},
journal= {arXiv preprint arXiv:2605.26478},
year = {2026}
}