中文

自私行为的自组织:强化学习揭示自私行为如何源于智能体—环境交互动力学

种群与进化 2023-03-29 v2 定量方法

摘要

当生物群落利用信号结构进行复杂协调时,会出现“搭便车者”。搭便车智能体不为群落资源(信号)做贡献,却对其加以利用。此类“自私”行为的大多数模型将搭便车视为通过突变与选择而演化。在世代更替中,被视为产生稳定性状的突变在种群中扩散。这可能导致“公地悲剧”的一种形式,即群落的协调资源被完全耗尽或恶化。与这种演化观点相反,我们提出一个强化学习模型,表明基于能量最小化的学习可使基于信号的协调与搭便车行为均在一代之内涌现。进一步,我们表明可能存在两类搭便车,且二者均非稳定性状,而是智能体—环境交互的动态“凝聚体”。我们的模型由此展示了不同种类的自私行为如何通过自组织涌现,并提示将自私视为稳定性状的观念预设了一种基于突变的模型。最后我们讨论了该模型的一些社会与政策启示。

关键词

引用

@article{arxiv.2302.14778,
  title  = {The self-organization of selfishness: Reinforcement Learning shows how selfish behavior can emerge from agent-environment interaction dynamics},
  author = {Aamir Sahil Chandroth and Nithya Ramakrishnan and Sanjay Chandrasekharan},
  journal= {arXiv preprint arXiv:2302.14778},
  year   = {2023}
}

备注

9 pages, 16 figs, 1 table. Reinforcement Learning - Parametric Analysis, Social Behavior