基于级联系统表示的零样本泛化
机器人学
2020-12-25 v3
摘要
深度强化学习已被孤立地应用于解决多种控制问题。然而,习得的潜在表示在没有额外训练或调参的情况下,无法被最优地复用于其他类似任务和/或控制系统。对此,我们提出一种新颖框架,可用于为整类类似控制系统学习单一控制策略。该框架缩写为 CASNET,它利用类似控制系统设计中的相似性来学习通用抽象系统表示。该框架使用基于循环神经网络的编码器级联来创建这些表示,随后将其作为输入馈入常规策略网络。类似的译码器级联对策略网络的输出进行解码以生成系统特定输出。我们在可以说是最显著的 DRL 用例——机器人技术上说明了该框架的有效性。在本文中,我们使用 CASNET 为两类独立机器人学习可泛化控制策略:平面机械臂与爬行机器人,分别使用 15+ 和 55+ 形态类似的仿真机器人。这些机器人模型涵盖了现实世界中最常用的设计变体。我们使用最先进的同策略与异策略学习算法的实证结果表明,平均而言,CASNET 智能体在未见过的机器人模型上实现了零样本最优性能(相当于为单个机器人模型训练的专家智能体的性能)。这些结果表明,习得策略的性能受限于学习算法而非框架本身。所提框架是迈向通用控制器的重要一步。
引用
@article{arxiv.1912.05501,
title = {Zero-shot generalization using cascaded system-representations},
author = {Ashish Malik},
journal= {arXiv preprint arXiv:1912.05501},
year = {2020}
}