中文

算子深度 Q 学习:强化学习中的零样本奖励迁移

机器学习 2022-01-04 v1 机器人学 机器学习

摘要

近年来,强化学习(RL)因其在各类应用中的巨大成功而受到越来越多的关注。然而,标准 RL 算法只能应用于单一奖励函数,且无法快速适应未见的奖励函数。本文倡导一种通用的强化学习算子视角,使我们能够直接近似从奖励函数到价值函数的映射算子。学习该算子的好处在于,我们可以将任意新奖励函数作为输入,以零样本方式获得其对应的价值函数。为近似这类特殊算子,我们基于其理论性质设计了一些新颖的算子神经网络架构。我们的算子网络设计优于现有方法及通用算子网络的标准设计,并在包括离线策略评估(OPE)的奖励迁移和一系列任务中的离线策略优化的奖励迁移等多个任务中展示了我们算子深度 Q 学习框架的优势。

关键词

引用

@article{arxiv.2201.00236,
  title  = {Operator Deep Q-Learning: Zero-Shot Reward Transferring in Reinforcement Learning},
  author = {Ziyang Tang and Yihao Feng and Qiang Liu},
  journal= {arXiv preprint arXiv:2201.00236},
  year   = {2022}
}