中文

从质量不一的对局中归纳博弈规则

机器学习 2020-08-05 v1 机器学习

摘要

通用博弈游戏(GGP)是一个框架,其中人工智能程序需要成功游玩多种游戏。它充当了人工智能的测试平台与研究推动力。人工智能在运行时获得一个随机的游戏描述,然后据此进行游戏。该框架包含博弈规则库。归纳式通用博弈游戏(IGGP)问题挑战机器学习系统通过观看游戏过程来学习这些 GGP 博弈规则。换言之,IGGP 是从特定游戏观测中归纳通用博弈规则的问题。归纳逻辑编程(ILP)已被证明是解决该问题的一种有前景的方法,尽管已有研究表明它对 ILP 系统而言仍是一个难题。现有关于 IGGP 的工作总是假设被观测的游戏玩家采取随机走子。这并不能代表人类学习玩游戏的方式。随机对局中不存在人类游玩时通常会遇到的情况。为弥补这一局限,我们分析了使用智能对局轨迹与随机对局轨迹的影响,以及改变训练集中轨迹数量的影响。我们使用 2014 年 GGP 竞赛冠军 Sancho 为大量游戏生成智能对局轨迹。随后我们使用 ILP 系统 Metagol、Aleph 和 ILASP 从轨迹中归纳博弈规则。我们在智能数据与随机数据的各种组合(包括两者混合)上训练和测试这些系统。我们还改变了训练数据的规模。我们的结果表明,尽管在某些实验中部分游戏比其他游戏学习得更有效,但总体上无统计显著的趋势。这项工作的意义在于,如本文所述改变训练数据的质量对所学博弈规则的准确性有强烈影响;然而,一种方案并不适用于所有游戏。

关键词

引用

@article{arxiv.2008.01664,
  title  = {Inducing game rules from varying quality game play},
  author = {Alastair Flynn},
  journal= {arXiv preprint arXiv:2008.01664},
  year   = {2020}
}