基于不对称现实残差的仿真策略 SPARR 用于装配
机器人学
2026-02-27 v1
摘要
机器人装配因需要精确的接触式操作而长期以来一直是一大挑战。虽然仿真学习已促进了鲁棒装配策略的开发,但其性能常在实际应用中因仿真-现实差距而下降。相反,现实世界强化学习方法可避免仿真-现实差距,但高度依赖人类监督,且缺乏对环境变化的泛化能力。本文提出一种混合方法,将在仿真中训练的基础策略与在现实世界中学习的现实残差策略相结合,以高效适应现实世界变化。基础策略在仿真中使用低层状态观察和稠密奖励训练,提供强大的初始行为先验。残差策略在现实世界中使用视觉观察和稀疏奖励学习,以补偿动力学和传感器噪声的差异。大量现实世界实验表明,我们的方法SPARR在多样化的两件装配任务中实现了接近完美的成功率。与当前零样本仿真-现实方法相比,SPARR提高了成功率38.4%,同时将循环时间缩短29.7%。此外,SPARR不需要人类专家知识,与依赖人类监督的当前现实世界RL方法形成鲜明对比。
引用
@article{arxiv.2602.23253,
title = {SPARR: Simulation-based Policies with Asymmetric Real-world Residuals for Assembly},
author = {Yijie Guo and Iretiayo Akinola and Lars Johannsmeier and Hugo Hadfield and Abhishek Gupta and Yashraj Narang},
journal= {arXiv preprint arXiv:2602.23253},
year = {2026}
}