中文

发现一组针对最坏情况奖励的策略

人工智能 2021-12-13 v2 机器学习

摘要

我们研究如何构造一组可组合在一起以解决一组强化学习任务的策略集的问题。每个任务是一个定义为已知特征的线性组合的不同奖励函数。我们考虑一类特定的策略组合,称之为集合改进策略(SIPs):给定一组策略与一组任务,SIP 是前者任一组合,其在所有任务上的表现至少与其组成部分一样好。我们聚焦于 SIP 最保守的实例,即集合最大策略(SMPs),因此我们的分析可推广至任意 SIP。这包括已知的策略组合算子如广义策略改进。我们的主要贡献是一种策略迭代算法,其构建一组策略以最大化所得 SMP 在任务集上的最坏情况性能。该算法通过 successively 向集合中添加新策略来工作。我们表明所得 SMP 的最坏情况性能在每次迭代中严格提升,且算法仅当不存在能带来性能提升的策略时才停止。我们在网格世界及来自 DeepMind 控制套件的一组领域上对所提算法进行经验评估。我们证实了关于算法性能单调提升的理论结果。有趣的是,我们还经验地表明算法计算的策略集具有多样性,导致网格世界中不同轨迹及控制套件中迥异的运动技能。

关键词

引用

@article{arxiv.2102.04323,
  title  = {Discovering a set of policies for the worst case reward},
  author = {Tom Zahavy and Andre Barreto and Daniel J Mankowitz and Shaobo Hou and Brendan O'Donoghue and Iurii Kemaev and Satinder Singh},
  journal= {arXiv preprint arXiv:2102.04323},
  year   = {2021}
}