端到端强化学习提升灵巧抓取策略
机器人学
2025-09-23 v1 机器学习
摘要
本研究探索了在机械臂+手系统中扩大基于图像的端到端灵巧抓取学习规模的技术。与基于状态的 RL 不同,基于视觉的 RL 在内存效率方面低得多,导致批量大小相对较小,这不利于 PPO 等算法的训练。尽管如此,它仍是一种极具吸引力的方法,因为与将基于状态的策略蒸馏为视觉网络的常用技术不同,端到端 RL 能够催生涌现的主动视觉行为。我们发现训练这些策略的一个关键瓶颈在于,大多数现有模拟器使用传统数据并行技术扩展至多 GPU 的方式。我们提出了一种新方法,将模拟器和 RL(包括训练和经验缓冲区)解耦至独立的 GPU 上。在配备四个 GPU 的节点上,我们在其中三个 GPU 上运行模拟器,在第四个上运行 PPO。我们能够证明,在相同数量 GPU 的情况下,与标准数据并行的先前基线相比,我们可以将现有环境数量增加一倍。这使我们能够端到端地训练基于视觉且带有深度的环境,而这些环境在基线方法下表现极差。我们训练并将基于深度和状态的策略蒸馏为立体 RGB 网络,结果表明深度蒸馏在仿真和现实中均取得了更好的效果。这种提升可能归因于状态策略与视觉策略之间存在可观测性差距,而在将深度策略蒸馏为立体 RGB 时不存在此差距。我们进一步表明,解耦模拟带来的更大批量大小也提升了真实世界的性能。在真实世界中部署时,我们使用端到端策略改进了先前基于视觉的 SOTA 结果。
引用
@article{arxiv.2509.16434,
title = {End-to-end RL Improves Dexterous Grasping Policies},
author = {Ritvik Singh and Karl Van Wyk and Pieter Abbeel and Jitendra Malik and Nathan Ratliff and Ankur Handa},
journal= {arXiv preprint arXiv:2509.16434},
year = {2025}
}
备注
See our blog post: https://e2e4robotics.com/