中文

重复囚徒困境中主动推断的解析模型

物理与社会 2023-08-31 v2 多智能体系统

摘要

本文利用主动推断框架处理了数学上可处理的囚徒困境模型。在这项工作中,我们设计了一对贝叶斯智能体,在重复囚徒困境游戏中追踪自身与对手选择的联合博弈状态。以部分可观测马尔可夫决策过程形式给出的智能体信念架构规范,允许对双人博弈动态进行仔细而严格的考察,包括推导实现特定博弈论稳态所需的相变最优条件。我们表明,控制相变的临界时间点作为学习率与奖励函数的函数彼此线性相关。随后我们研究了当改变智能体学习率时涌现的模式,以及该双智能体系统的随机解与确定性解之间的关系。

关键词

引用

@article{arxiv.2306.15494,
  title  = {An analytical model of active inference in the Iterated Prisoner's Dilemma},
  author = {Daphne Demekas and Conor Heins and Brennan Klein},
  journal= {arXiv preprint arXiv:2306.15494},
  year   = {2023}
}