通过个性化嵌入改进以机器人为中心的学习从演示
机器人学
2021-10-08 v1
摘要
学习从演示(LfD)技术旨在使新手用户能够在现实世界中教机器人新任务。然而,先前的工作表明,以机器人为中心的LfD方法,如数据集聚合(DAgger),在与人类教师配合时表现不佳。DAgger要求人类演示者实时向学习者提供纠正性反馈,而这可能因次优的人类标注而导致性能下降;或以事后方式提供反馈,这种方式耗时且通常不可行。为解决此问题,我们提出互信息驱动的从演示元学习(MIND MELD),该方法元学习从低质量人类标注到预测真值标注的映射,从而改进先前基于DAgger训练的LfD方法的性能。我们改进次优反馈方法的关键在于通过变分推断实现互信息最大化。我们的方法通过变分推断学习一个有意义的、个性化的嵌入,用以指导从人类提供的标注到预测真值标注的映射。我们在合成领域和一项人类受试者实验中展示了我们的框架,表明我们的方法将人类演示者提供的纠正性标注质量提升了63%。
引用
@article{arxiv.2110.03134,
title = {Improving Robot-Centric Learning from Demonstration via Personalized Embeddings},
author = {Mariah L. Schrum and Erin Hedlund and Matthew C. Gombolay},
journal= {arXiv preprint arXiv:2110.03134},
year = {2021}
}
备注
Presented at AI-HRI symposium as part of AAAI-FSS 2021 (arXiv:2109.10836)