中文

基于具身实时交互的社会惯例形成建模

多智能体系统 2020-01-03 v3 人工智能 计算机科学与博弈论 神经元与认知 机器学习

摘要

实时控制与学习在社会惯例形成中的作用是什么?为回答此问题,我们提出一个计算模型,该模型在离散时间与连续时间设定下分析的社会决策博弈中均能与人类行为数据吻合。此外,与以往方法不同,我们的模型考虑了具身决策场景中感觉运动控制回路的作用。为此,我们引入基于控制的强化学习(CRL)模型。CRL立足于心智与大脑的分布式自适应控制(DAC)理论,其中低级感觉运动控制通过分层结构中的感知与行为学习进行调节。CRL遵循这些原理,实现了一个处理智能体反应性行为(预置反射)的反馈控制回路,以及一个使用强化学习最大化长期奖励的自适应层。我们在多智能体博弈论任务中测试模型,该任务需通过协调找到最优解。我们表明,CRL在标准博弈论指标(如获取奖励的效率与奖励分配的公平性)上能够达到人类水平表现。

关键词

引用

@article{arxiv.1802.06108,
  title  = {Modeling the Formation of Social Conventions from Embodied Real-Time Interactions},
  author = {Ismael T. Freire and Clement Moulin-Frier and Marti Sanchez-Fibla and Xerxes D. Arsiwalla and Paul Verschure},
  journal= {arXiv preprint arXiv:1802.06108},
  year   = {2020}
}

备注

16 pages, 7 figures