关键帧示范播种与贝叶斯优化策略搜索
机器人学
2023-01-20 v1
摘要
本文提出了一种新颖的示范学习框架,利用动态贝叶斯网络(DBN)和贝叶斯优化策略搜索方法,通过关键帧示范来学习机器人技能并改进所学技能。DBN学习机器人运动、感兴趣对象的感知变化(即技能子目标)以及二者之间的关系。奖励同样从DBN的感知部分中学习。策略搜索部分是一个半黑箱算法,我们称之为BO-PI2。它利用动作-感知关系聚焦于高层探索,使用高斯过程对期望回报建模,并执行上置信界类型的低层探索以采样rollout。BO-PI2在真实机器人环境中,针对三种不同技能,在专家与新手用户示范下与一种最先进方法进行比较。结果表明,我们的方法成功将探索聚焦于失败的子目标,并且加入奖励预测探索在累积奖励、技能成功率和终止时间指标上优于最先进方法。
引用
@article{arxiv.2301.08184,
title = {Keyframe Demonstration Seeded and Bayesian Optimized Policy Search},
author = {Onur Berk Tore and Farzin Negahbani and Baris Akgun},
journal= {arXiv preprint arXiv:2301.08184},
year = {2023}
}