基于平均奖赏强化学习的零级分类器系统中的锦标赛选择
人工智能
2016-04-27 v1 神经与进化计算
摘要
作为一种基于遗传的机器学习技术,零级分类器系统(zeroth-level classifier system, ZCS)基于折扣奖赏强化学习算法——桶旅算法(bucket-brigade algorithm),该算法优化智能体接收到的折扣总奖赏,但不适用于所有多步问题,尤其是大规模问题。存在一些无折扣强化学习方法,如R学习(R-learning),其优化每时间步的平均奖赏。本文中,R学习被用作ZCS采用的强化学习,以替代其折扣奖赏强化学习方法,并且使用锦标赛选择(tournament selection)替代ZCS中的轮盘赌选择(roulette wheel selection)。该修改产生了能够支持长动作链的分类器系统,从而能够解决大规模多步问题。
引用
@article{arxiv.1604.07704,
title = {Tournament selection in zeroth-level classifier systems based on average reward reinforcement learning},
author = {Zhaoxiang Zang and Zhao Li and Junying Wang and Zhiping Dan},
journal= {arXiv preprint arXiv:1604.07704},
year = {2016}
}
备注
14 pages, 3 figures