C-3PO:基于强化学习的人-机器人运动重定向循环三阶段优化
机器人学
2020-03-04 v3 机器学习
摘要
在具有不同尺寸与运动学配置的异质多形态间进行运动重定向需要(逆)运动学的综合知识。此外,提供一个运动学无关的通用解并非易事。本研究开发了一种基于深度强化学习的循环三阶段优化方法,用于人-机器人运动重定向。运动重定向学习通过我们方法的循环与滤波路径在潜空间中使用精炼数据完成。此外,基于人在回路的三阶段方法提供了一个通过定量与定性方式改进运动重定向策略的框架。使用所提 C-3PO 方法,我们成功学习了人体骨架与 NAO、Pepper、Baxter 及 C-3PO 等多个机器人运动之间的运动重定向技能。
引用
@article{arxiv.1909.11303,
title = {C-3PO: Cyclic-Three-Phase Optimization for Human-Robot Motion Retargeting based on Reinforcement Learning},
author = {Taewoo Kim and Joo-Haeng Lee},
journal= {arXiv preprint arXiv:1909.11303},
year = {2020}
}
备注
Accepted in ICRA 2020