中文

一种基于双重竞争策略的学习自动机算法

人工智能 2017-12-04 v1

摘要

学习自动机(LA)被认为是强化学习领域最强有力的工具之一。估计器算法族被提出以提升LA的收敛速度并取得了巨大成就。然而,估计器在LA学习过程初始阶段对动作奖励概率的估计表现不佳。在这种情况下,大量奖励会被加到非最优动作的概率上。因此,需要大量额外迭代来补偿这些错误奖励。为提升收敛速度,我们利用为更新动作概率向量而设计的双重竞争策略,提出了一种新的P模型吸收式学习自动机。如此,错误奖励可被即时纠正。因而,所提出的双重竞争算法克服了现有估计器算法的缺陷。给出了精炼分析以展示所提方案的ϵ最优性\epsilon-最优性。在基准环境下的广泛实验结果表明,我们提出的学习自动机比最经典的LA SERISE_{RI}和当前最快的LA DGCPADGCPA^{*}表现更高效。

关键词

引用

@article{arxiv.1712.00222,
  title  = {A double competitive strategy based learning automata algorithm},
  author = {Chong Di},
  journal= {arXiv preprint arXiv:1712.00222},
  year   = {2017}
}