重复囚徒困境中主动推断的解析模型
物理与社会
2023-08-31 v2 多智能体系统
摘要
本文利用主动推断框架处理了数学上可处理的囚徒困境模型。在这项工作中,我们设计了一对贝叶斯智能体,在重复囚徒困境游戏中追踪自身与对手选择的联合博弈状态。以部分可观测马尔可夫决策过程形式给出的智能体信念架构规范,允许对双人博弈动态进行仔细而严格的考察,包括推导实现特定博弈论稳态所需的相变最优条件。我们表明,控制相变的临界时间点作为学习率与奖励函数的函数彼此线性相关。随后我们研究了当改变智能体学习率时涌现的模式,以及该双智能体系统的随机解与确定性解之间的关系。
引用
@article{arxiv.2306.15494,
title = {An analytical model of active inference in the Iterated Prisoner's Dilemma},
author = {Daphne Demekas and Conor Heins and Brennan Klein},
journal= {arXiv preprint arXiv:2306.15494},
year = {2023}
}