高效利用启发式加速马尔可夫博弈中基于 XCS 的策略学习
人工智能
2020-05-27 v1 计算机科学与博弈论
多智能体系统
神经与进化计算
摘要
在马尔可夫博弈中,与具有学习能力且非平稳的对手博弈对强化学习(RL)智能体而言仍具挑战性,因为对手可同时演化其策略。这增加了学习任务复杂度并减慢了 RL 智能体的学习速度。本文提出高效利用粗略启发式,以在与并发学习者博弈时加速策略学习。具体地,我们提出一种算法,通过在零和马尔可夫博弈中利用定量启发式的表示与带扩展分类器系统(XCS)的对手模型,高效学习可解释且泛化的动作选择规则。使用神经网络从对手行为中建模对手,并推断相应策略用于动作选择与规则演化。在存在多种启发式策略的情况下,我们引入帕累托最优(Pareto optimality)概念用于动作选择。此外,利用 XCS 的条件表示与匹配机制,启发式策略与对手模型可为具有相似特征表示的情况提供指导。进一步,我们引入基于准确性的资格迹(eligibility trace)机制以加速规则演化,即能匹配历史迹的分类器根据其准确性被强化。我们在足球与贼捕猎场景中将所提算法优于若干基准算法的优势进行了展示。
引用
@article{arxiv.2005.12553,
title = {Efficient Use of heuristics for accelerating XCS-based Policy Learning in Markov Games},
author = {Hao Chen and Chang Wang and Jian Huang and Jianxing Gong},
journal= {arXiv preprint arXiv:2005.12553},
year = {2020}
}