MANGA:方法无关的神经策略泛化与自适应
机器学习
2019-11-20 v1 人工智能
机器人学
机器学习
摘要
本文中,我们旨在通过引入一个将策略学习与系统辨识过程解耦的框架,解决跨具有不同动力学参数与电机噪声变化的多种环境迁移策略的问题。在存在电机噪声且动力学配置变化的情况下,将学到的策略高效迁移到未知环境,对真实世界中的机器人操作非常重要,而我们的工作是该方向的新颖尝试。我们提出 MANGA:方法无关的神经策略泛化与自适应(Method Agnostic Neural-policy Generalization and Adaptation),其训练动力学条件策略,并基于环境中离策略状态转移滚动数据高效学习估计环境的动力学参数。我们的方案与所用训练方法类型无关——既可使用强化学习(RL)也可使用模仿学习(IL)策略。我们通过四个不同 MuJoCo 智能体的实验并与先前提出的迁移基线比较,证明了方法的有效性。
引用
@article{arxiv.1911.08444,
title = {MANGA: Method Agnostic Neural-policy Generalization and Adaptation},
author = {Homanga Bharadhwaj and Shoichiro Yamaguchi and Shin-ichi Maeda},
journal= {arXiv preprint arXiv:1911.08444},
year = {2019}
}
备注
Under Review. Video available at https://drive.google.com/file/d/12GsDq3iQDXEutE-xpzXxqrEfD6dYhKjs/view?usp=sharing Other details will be made available in the author's webpage www.homangabharadhwaj.com