中文

受约束抽样以引导通用操作强化学习

机器人学 2026-02-10 v1

摘要

我们考察如何利用基于模型的方法求解器来指导训练用于从任意可行初始状态控制到任意可行目标的通用策略,这种控制场景充满接触。虽然强化学习 (RL) 在此类场景中展现出强大能力,但在稀疏奖励环境下可能难以充分探索并发现复杂的操作策略。我们的做法基于这样一种思想:在此类操作过程中,存在一组低维可行且可能被访问的状态的流形。我们提出 Sample-Guided RL,该方法利用来自该流形上的抽样器来引导 RL。Sample-Guided RL 使用基于模型的约束求解器高效地抽样出满足可微分碰撞、接触和力约束的可行配置,并利用这些配置来引导 RL 实现通用 (目标条件) 操作策略。我们研究两种数据直接用于偏置状态访问,以及利用黑箱优化在随机配置之间的开环轨迹来施加状态偏置并可选添加行为克隆损失。在最小化的双球操作场景中,Sample-Guided RL 发现了复杂的操作策略,并在到达任意静态稳定状态方面取得高成功率。在更具挑战性的熊猫机械臂场景中,我们的方法相对于接近零的基线取得了显著的成功率,展示了多样化的复杂全身接触操作策略。

关键词

引用

@article{arxiv.2602.08557,
  title  = {Constrained Sampling to Guide Universal Manipulation RL},
  author = {Marc Toussaint and Cornelius V. Braun and Eckart Cobo-Briesewitz and Sayantan Auddy and Armand Jordana and Justin Carpentier},
  journal= {arXiv preprint arXiv:2602.08557},
  year   = {2026}
}