强化学习智能体中涌现的支配等级
多智能体系统
2024-06-25 v7 人工智能
计算机科学与博弈论
机器学习
摘要
现代强化学习(RL)算法能够在多种任务中超越人类表现。多智能体强化学习(MARL)环境带来了额外的挑战,在混合动机的智能体群体中,成功的合作取决于个体目标与群体目标之间的微妙平衡。通常受人类制度启发的社会习俗和规范被用作实现这种平衡的工具。在本文中,我们研究了一种基础且已被深入研究的社会习俗,它是动物和人类社会中合作的基础:支配等级。我们将动物行为学中关于支配等级的理论应用于人工智能体,尽可能少地修改地借用了既定的术语和定义。我们证明,在没有显式编程或内在奖励的情况下,RL 智能体群体能够发明、学习、执行并将支配等级传递给新的群体。涌现出的支配等级与在鸡、鼠、鱼和其他物种中研究的等级具有相似的结构。
引用
@article{arxiv.2401.12258,
title = {Emergent Dominance Hierarchies in Reinforcement Learning Agents},
author = {Ram Rachum and Yonatan Nakar and Bill Tomlinson and Nitay Alon and Reuth Mirsky},
journal= {arXiv preprint arXiv:2401.12258},
year = {2024}
}