非对称博弈中软件智能体大型锦标赛的 Elo 评级
人工智能
2021-05-04 v1 计算机科学与博弈论
摘要
Elo 评级系统已在世界范围内的个人与团体运动中得到使用,如欧洲围棋联合会(EGF)、国际象棋联合会(FIDE)、国际足球联合会(FIFA)等许多机构所示。为评估人工智能体的性能,很自然地以与人类相同的 Elo 尺度来评估它们,例如赋予 AlphaGo Zero 的 5185 分评级。人类与 AI 之间存在若干根本差异,表明需要对系统进行修改,这反过来要求重新审视 Elo 的基本依据。AI 通常在比人类所下多得多的对局上训练,且我们对新创建的 AI 智能体几乎没有什么先验信息。此外,AI 正被扩展到玩家间非对称的博弈中,甚至可能具有每局设置不同的大型复杂棋盘,例如商业纸面策略游戏。我们提出了一种修正的评级系统以及锦标赛指南,以反映这些差异。
引用
@article{arxiv.2105.00839,
title = {Elo Ratings for Large Tournaments of Software Agents in Asymmetric Games},
author = {Ben Wise},
journal= {arXiv preprint arXiv:2105.00839},
year = {2021}
}
备注
75 pages, 11 figures