利用专家乘积从演示中学习:在操纵与任务优先级中的应用
机器人学
2020-10-08 v1 机器学习
摘要
概率分布是许多从演示中学习(LfD)方法的关键组成部分。虽然机械臂的构型由其关节角定义,但位姿常在若干任务空间中才能得到最好的解释。在许多方法中,相关任务空间中的分布被独立学习,并仅在控制层进行组合。这一简化带来了若干本文所解决的问题。我们表明,不同任务空间中模型的融合可表示为专家乘积(PoE),其中各模型的概率被相乘并重新归一化,从而成为关节角的恰当分布。我们给出了多个实验以表明,在 PoE 框架下联合学习不同模型显著提升了模型质量。当机器人须学习竞争性或层次化目标时,所提方法尤为突出。联合训练模型通常依赖对比散度,其需要代价高昂的近似并可能影响性能。我们提出了一种使用变分推断与混合模型近似的替代策略。特别地,我们表明所提方法可推广到具有零空间结构的专家乘积(PoENS),该模型能够恢复被高层目标求解所掩盖的任务。
引用
@article{arxiv.2010.03505,
title = {Learning from demonstration using products of experts: applications to manipulation and task prioritization},
author = {Emmanuel Pignat and João Silvério and Sylvain Calinon},
journal= {arXiv preprint arXiv:2010.03505},
year = {2020}
}