中文

基于平均奖赏强化学习的零级分类器系统中的锦标赛选择

人工智能 2016-04-27 v1 神经与进化计算

摘要

作为一种基于遗传的机器学习技术,零级分类器系统(zeroth-level classifier system, ZCS)基于折扣奖赏强化学习算法——桶旅算法(bucket-brigade algorithm),该算法优化智能体接收到的折扣总奖赏,但不适用于所有多步问题,尤其是大规模问题。存在一些无折扣强化学习方法,如R学习(R-learning),其优化每时间步的平均奖赏。本文中,R学习被用作ZCS采用的强化学习,以替代其折扣奖赏强化学习方法,并且使用锦标赛选择(tournament selection)替代ZCS中的轮盘赌选择(roulette wheel selection)。该修改产生了能够支持长动作链的分类器系统,从而能够解决大规模多步问题。

关键词

引用

@article{arxiv.1604.07704,
  title  = {Tournament selection in zeroth-level classifier systems based on average reward reinforcement learning},
  author = {Zhaoxiang Zang and Zhao Li and Junying Wang and Zhiping Dan},
  journal= {arXiv preprint arXiv:1604.07704},
  year   = {2016}
}

备注

14 pages, 3 figures