中文

通过交互语言模型系统中的镜像行为研究社会对齐

多智能体系统 2025-02-18 v2 人工智能 计算机与社会

摘要

对齐是一种社会现象,个体在其中共享共同的目标或视角。镜像,即模仿另一个个体的行为和意见,是个体实现对齐的一种机制。由于传统社会学实验设计的可扩展性限制,对镜像对齐效应的大规模研究一直受到限制。在本文中,我们引入了一个简单的计算框架,能够在多智能体系统中研究镜像行为对齐效应。我们在该框架中模拟交互式大语言模型系统,并通过智能体动力学的定量度量来表征整体系统行为和对齐。我们发现系统行为受到每个智能体通信范围的强烈影响,且这些效应因镜像率的增加而加剧。我们在已知人类社会动态的背景下讨论了所观察到的模拟系统行为。

关键词

引用

@article{arxiv.2412.06834,
  title  = {Investigating social alignment via mirroring in a system of interacting language models},
  author = {Harvey McGuinness and Tianyu Wang and Carey E. Priebe and Hayden Helm},
  journal= {arXiv preprint arXiv:2412.06834},
  year   = {2025}
}