多人工智能在迭代石头-剪刀-布游戏中与人类竞争并取胜
计算机科学与博弈论
2020-11-24 v2 机器学习
摘要
预测和建模人类行为并发现人类决策过程中的趋势,是社会科学的一个主要问题。石头-剪刀-布(RPS)是许多博弈论问题与真实世界竞争中的基本策略问题。找到正确方法以击败特定人类对手具有挑战性。在此,我们使用一种基于固定记忆长度马尔可夫模型(缩写为“single AI”)的 AI(人工智能)算法,在迭代 RPS 游戏中与人类竞争。我们通过组合许多具有不同固定记忆长度的马尔可夫模型(缩写为“multi-AI”)来建模和预测人类竞争行为,并开发了具有可变参数的多人工智能架构以适应不同的竞争策略。我们引入一个名为“focus length”(聚焦长度,如 5 或 10 的正整数)的参数,以控制我们的多人工智能适应对手策略变化的速度与灵敏度。聚焦长度是多人工智能在决定哪个 Single-AI 表现最佳并应选用于下一局时,所应查看的之前回合的数量。我们与 52 个不同的人进行了实验,每人连续与某一特定多人工智能模型对弈 300 回合,并证明我们的策略能够战胜超过 95% 的人类对手。
引用
@article{arxiv.2003.06769,
title = {Multi-AI competing and winning against humans in iterated Rock-Paper-Scissors game},
author = {Lei Wang and Wenbin Huang and Yuanpeng Li and Julian Evans and Sailing He},
journal= {arXiv preprint arXiv:2003.06769},
year = {2020}
}