中文

目标条件化的深度策略生成器

机器学习 2022-07-05 v1 机器学习

摘要

目标条件化强化学习(RL)旨在学习最优策略,给定编码于特殊指令输入中的目标。本文研究目标条件化神经网络(NN),其学习以特定上下文的权重矩阵形式生成深度 NN 策略,类似于快速权重程序员及 1990 年代的其他方法。利用形如“生成一个达到期望期望回报的策略”的上下文指令,我们的 NN 生成器将参数空间的强大探索与跨指令的泛化相结合,迭代地找到越来越好的策略。一种权重共享的超网络(HyperNetworks)与策略嵌入形式将我们的方法扩展到生成深度 NN。实验展示了单个已学习的策略生成器如何产生在训练期间所见过的任意回报的策略。最后,我们在一组连续控制任务上评估我们的算法,其表现出具有竞争力的性能。我们的代码已公开。

关键词

引用

@article{arxiv.2207.01570,
  title  = {Goal-Conditioned Generators of Deep Policies},
  author = {Francesco Faccio and Vincent Herrmann and Aditya Ramesh and Louis Kirsch and Jürgen Schmidhuber},
  journal= {arXiv preprint arXiv:2207.01570},
  year   = {2022}
}

备注

Preprint. Under Review