中文

文艺复兴机器人:用于学习多样技能的最优传输策略融合

机器学习 2022-07-05 v1 机器人学

摘要

深度强化学习(RL)是解决复杂机器人问题的一种有前景的方法。然而,尽管近期 RL 算法取得了进展,通过试错交互进行学习的过程往往仍极为耗时。此外,RL 的成功关键取决于奖励塑形函数对任务的适配程度,而设计该函数同样耗时。随着在各类机器人问题上训练的智能体不断增多,将其宝贵的学习经验复用于新领域变得愈发重要。本文中,我们提出一种事后策略融合技术,利用最优传输理论作为稳健手段,来整合在不同场景中训练过的多个智能体的知识。我们进一步证明,这为学习新任务的神经网络策略提供了改进的权重初始化,比重新训练父策略或从零训练新策略所需的时间和计算资源更少。最终,我们在深度 RL 中常用的多样智能体上的结果表明,专门知识可以被统一为一个“文艺复兴智能体”,从而实现新技能的更快速学习。

关键词

引用

@article{arxiv.2207.00978,
  title  = {Renaissance Robot: Optimal Transport Policy Fusion for Learning Diverse Skills},
  author = {Julia Tan and Ransalu Senanayake and Fabio Ramos},
  journal= {arXiv preprint arXiv:2207.00978},
  year   = {2022}
}