基于原语技能的机器人从人类评价反馈中学习
机器人学
2023-08-03 v2 人工智能
摘要
强化学习(RL)算法在处理真实世界环境中的长程机器人操作任务时,由于样本效率低和安全性问题而面临重大挑战。为克服这些挑战,我们提出了一种新颖的框架 SEED,它结合了两种方法:基于人类反馈的强化学习(RLHF)和基于原语技能的强化学习。这两种方法在解决稀疏奖励问题和长程任务复杂性方面尤其有效。通过结合二者,SEED 减少了 RLHF 所需的人力,并提高了在真实世界中使用 RL 训练机器人操作的安全性。此外,参数化技能清晰展示了智能体的高层意图,使人类能够在技能执行前评估技能选择。这一特性使训练过程更加安全高效。为评估 SEED 的性能,我们在五个复杂度各异的操作任务上进行了大量实验。结果表明,SEED 在样本效率和安全性上显著优于最先进的 RL 算法。此外,与其他 RLHF 方法相比,SEED 还大幅减少了人力投入。更多细节和视频结果见 https://seediros23.github.io/。
引用
@article{arxiv.2307.15801,
title = {Primitive Skill-based Robot Learning from Human Evaluative Feedback},
author = {Ayano Hiranaka and Minjune Hwang and Sharon Lee and Chen Wang and Li Fei-Fei and Jiajun Wu and Ruohan Zhang},
journal= {arXiv preprint arXiv:2307.15801},
year = {2023}
}