中文

面向强化学习的值映射协同编排

机器学习 2022-03-18 v2 人工智能

摘要

我们提出了一类通用的收敛强化学习算法,其基于两个不同原则:(1) 使用来自广泛类别的任意函数将价值估计映射到不同空间;(2) 将奖励信号线性分解为多个通道。第一个原则能够将特定性质引入价值估计器从而增强学习。另一方面,第二个原则允许将价值函数表示为多个效用函数的组合。这可用于多种目的,例如处理高度变化的奖励尺度、融入关于奖励来源的先验知识,以及集成学习。结合这两个原则产生了一个通用蓝图,通过在多个奖励通道上协同编排多样的映射函数来实例化收敛算法。该蓝图推广并包含了诸如 Q-Learning、Log Q-Learning 和 Q-Decomposition 等算法。此外,我们针对该通用类的收敛性证明放宽了其中某些算法所需的一些假设。基于我们的理论,我们讨论了若干有趣的配置作为特例。最后,为说明我们的理论所开启的设计空间的潜力,我们实例化了一个特定算法并在 Atari 测试集上评估了其性能。

关键词

引用

@article{arxiv.2203.07171,
  title  = {Orchestrated Value Mapping for Reinforcement Learning},
  author = {Mehdi Fatemi and Arash Tavakoli},
  journal= {arXiv preprint arXiv:2203.07171},
  year   = {2022}
}

备注

Published at ICLR 2022