面向一次性模仿学习的符号规划器连续松弛
人工智能
2019-11-06 v2 机器学习
机器人学
摘要
我们研究一次性模仿学习,其目标是基于单次演示执行此前未见的任务。尽管在该方向上已取得令人振奋的进展,大多数方法仍需要数百个任务进行元训练,这限制了方法的可扩展性。我们的主要贡献是将一次性模仿学习表述为符号规划问题以及符号接地问题。该表述将策略执行与任务间泛化解耦,从而带来更好的数据效率。关键的技术挑战在于符号接地在有限训练数据下容易出错,并导致随后的符号规划失败。我们通过提出离散符号规划器的连续松弛来解决这一挑战,该松弛直接在符号接地模型的概率输出上进行规划。我们对规划器的连续松弛仍可利用概率符号接地中所含信息,并在无需大量训练数据的情况下显著优于基线规划器处理一次性模仿学习任务。
引用
@article{arxiv.1908.06769,
title = {Continuous Relaxation of Symbolic Planner for One-Shot Imitation Learning},
author = {De-An Huang and Danfei Xu and Yuke Zhu and Animesh Garg and Silvio Savarese and Li Fei-Fei and Juan Carlos Niebles},
journal= {arXiv preprint arXiv:1908.06769},
year = {2019}
}
备注
IROS 2019