一种基于双重竞争策略的学习自动机算法
人工智能
2017-12-04 v1
摘要
学习自动机(LA)被认为是强化学习领域最强有力的工具之一。估计器算法族被提出以提升LA的收敛速度并取得了巨大成就。然而,估计器在LA学习过程初始阶段对动作奖励概率的估计表现不佳。在这种情况下,大量奖励会被加到非最优动作的概率上。因此,需要大量额外迭代来补偿这些错误奖励。为提升收敛速度,我们利用为更新动作概率向量而设计的双重竞争策略,提出了一种新的P模型吸收式学习自动机。如此,错误奖励可被即时纠正。因而,所提出的双重竞争算法克服了现有估计器算法的缺陷。给出了精炼分析以展示所提方案的。在基准环境下的广泛实验结果表明,我们提出的学习自动机比最经典的LA 和当前最快的LA 表现更高效。
引用
@article{arxiv.1712.00222,
title = {A double competitive strategy based learning automata algorithm},
author = {Chong Di},
journal= {arXiv preprint arXiv:1712.00222},
year = {2017}
}