面向真实世界机器人强化学习的反事实预测离线学习
机器人学
2022-03-01 v2 人工智能
摘要
我们考虑涉及视觉运动技能与富含接触技能的机器人操作任务的真实世界强化学习(RL)。我们的目标是在实际考量下训练一个将多模态感官观测(视觉与力)映射到机械臂关节速度的策略。我们提出利用离线样本学习一组从视觉输入进行反事实预测的通用值函数(GVFs)。我们表明,在在线策略学习中将离线学习的反事实预测与力反馈相结合,可在仅给定终止(成功/失败)奖励的情况下实现高效的强化学习。我们认为,所学得的反事实预测形成了一种紧凑且信息丰富的表征,能够实现样本效率,并提供引导在线探索朝向富含接触状态的辅助奖励信号。我们在仿真与真实世界环境中进行了多种实验以进行评估。真实世界机器人训练的录像可通过 https://sites.google.com/view/realrl 查看。
引用
@article{arxiv.2011.05857,
title = {Offline Learning of Counterfactual Predictions for Real-World Robotic Reinforcement Learning},
author = {Jun Jin and Daniel Graves and Cameron Haigh and Jun Luo and Martin Jagersand},
journal= {arXiv preprint arXiv:2011.05857},
year = {2022}
}
备注
Accepted in ICRA 2022