中文

在迭代囚徒困境中通过在线学习模拟人类行为

计算机科学与博弈论 2022-08-30 v3 人工智能 机器学习 多智能体系统 神经元与认知

摘要

作为重要的心理与社会实验,迭代囚徒困境(IPD)将合作或背叛的选择视为原子动作。我们提出研究在线学习算法在迭代囚徒困境(IPD)博弈中的行为,考察了强化学习智能体的完整谱系:多臂老虎机、上下文老虎机与强化学习。我们基于一个多智能体可按顺序竞争的迭代囚徒困境锦标赛对它们进行评估。这使我们能够分析多个自利、独立奖励驱动智能体所学策略的动力学,也使我们能够研究这些算法拟合人类行为的能力。结果表明,在此类社会困境博弈中,考虑当前局势做决策是最差的。我们陈述了关于在线学习行为的多项发现与临床验证,以努力将人工智能算法与人类行为及其在神经精神疾患中的异常状态相联系。

关键词

引用

@article{arxiv.2006.06580,
  title  = {Online Learning in Iterated Prisoner's Dilemma to Mimic Human Behavior},
  author = {Baihan Lin and Djallel Bouneffouf and Guillermo Cecchi},
  journal= {arXiv preprint arXiv:2006.06580},
  year   = {2022}
}

备注

Proceeding of PRICAI 2022. To the best of our knowledge, this is the first attempt to explore the full spectrum of reinforcement learning agents (multi-armed bandits, contextual bandits and reinforcement learning) in the sequential social dilemma. Codes at https://github.com/doerlbh/dilemmaRL