从演示中学习行为库
机器学习
2019-07-09 v1 人工智能
摘要
模仿学习(IL)是一种从演示数据集中学习策略的机器学习方法。IL 可用于在应用强化学习(RL)之前启动学习,但也可独立使用,例如在视频游戏中学习模仿人类玩家。然而,当前 IL 方法的一个主要局限是,它们仅基于可能包含多种不同类型行为演示的数据集学习单一的“平均”策略。在本文中,我们提出一种称为行为库模仿学习(BRIL)的新方法,该方法通过用行为描述增强状态-动作对,从一组演示中学习行为库。该方法的结果是一个以行为描述为条件的单一神经网络策略,可进行精确调制。我们应用该方法在 7,777 个人类回放上训练策略,以在 StarCraft II 中执行建造顺序规划。应用主成分分析(PCA)从每个演示的高维军队单位构成中构建低维行为空间。结果表明,学习到的策略可被有效操控以表达不同行为。此外,通过应用 UCB1 算法,我们能够在游戏之间调整策略的行为,以达到超越传统 IL 基线方法的性能。
引用
@article{arxiv.1907.03046,
title = {Learning a Behavioral Repertoire from Demonstrations},
author = {Niels Justesen and Miguel Gonzalez Duque and Daniel Cabarcas Jaramillo and Jean-Baptiste Mouret and Sebastian Risi},
journal= {arXiv preprint arXiv:1907.03046},
year = {2019}
}