中文

大型语言模型的从众效应:做与所想的差异

计算与语言 2025-02-12 v2

摘要

近期大型语言模型(LLM)的快速发展推动了智能代理领域的发展,使其能够构建能够跨越多个领域解决复杂问题的协作多智能体系统。然而,类比人类群体动力学中从众偏见和团队思维现象,LLM系统内部是否存在从众效应仍鲜有探讨,这引发了对其集体问题解决能力及潜在伦理影响的担忧。本文提出了LLM驱动的多智能体系统从众效应的全面研究,聚焦三个方面:从众效应的存在性、影响从众效应的因素以及潜在的缓解策略。具体而言,我们引入了BenchForm—a全新的面向从众效应的基准测试,包含推理密集型任务和五种不同的交互协议,用以探测LLM在协作场景中的行为。我们对几类代表性LLM进行评估,使用从众率和独立率等指标量化从众效应的影响。我们的分析深入探讨了影响从众效应的因素,包括交互时间和多数派规模,并考察了主体智能体如何为其从众行为辩护。此外,我们探讨了两种缓解从众效应的策略,即开发增强型人格和实施反思机制。来自实证结果和案例研究的若干有趣发现揭示了LLM从众效应的行为特征。我们希望这些洞见能为构建更健壮且符合伦理准则的协作AI系统铺路。我们的基准测试和代码已公开于BenchForm。

关键词

引用

@article{arxiv.2501.13381,
  title  = {Do as We Do, Not as You Think: the Conformity of Large Language Models},
  author = {Zhiyuan Weng and Guikun Chen and Wenguan Wang},
  journal= {arXiv preprint arXiv:2501.13381},
  year   = {2025}
}

备注

ICLR 2025 (Oral). Code: https://github.com/Zhiyuan-Weng/BenchForm