利用多环境进行学习与决策:一个拆解用例
机器人学
2021-08-04 v2
摘要
学习通常通过观测真实机器人执行来完成。基于物理的模拟器是一种良好的替代方案,可在避免代价高昂且可能破坏性的机器人执行的同时提供极高价值的信息。我们提出了一种学习符号化机器人动作结果概率的新方法。这是在执行时利用不同环境(如基于物理的模拟器)来实现的。为此,我们提出 MENID(多环境噪声不确定性指示)规则,一种能够应对机器人任务中固有不确定性的新表示。MENID 规则显式表示动作的每个可能结果,记忆经验来源,并维护各结果的成功概率。我们还引入了一种基于既往经验与期望增益在环境间分配动作的算法。在使用基于物理的仿真前,我们提出一种评估不同仿真设置并确定可产生连贯结果且最省时的模型的方法论。我们在拆解用例中验证了该方法的有效性,使用降质仿真作为模拟系统,并使用全分辨率仿真(其中我们向轨迹及若干物理参数添加噪声以表征真实系统)。
引用
@article{arxiv.2009.08837,
title = {Leveraging Multiple Environments for Learning and Decision Making: a Dismantling Use Case},
author = {Alejandro Suárez-Hernández and Thierry Gaugry and Javier Segovia-Aguas and Antonin Bernardin and Carme Torras and Maud Marchal and Guillem Alenyà},
journal= {arXiv preprint arXiv:2009.08837},
year = {2021}
}
备注
In the proceedings of IEEE/RSJ IROS 2020: https://ieeexplore.ieee.org/document/9341182