中文

感知与灵敏性:基于大语言模型的社会动态仿真评估

计算机与社会 2024-12-09 v1

摘要

大语言模型日益被提议作为经典基于智能体的模型(ABM)来模拟社会动态的强有力替代品。通过将LLM用作人类行为的代理,新的方法希望能够模拟远比经典ABM更复杂的动态,并在社会科学、政治科学和经济学等领域获得新见解。然而,由于大语言模型的黑箱本质,尚不清楚LLM代理是否实际执行其在自然语言指令中编码的预期语义,以及交互结果的动态是否具有意义。为研究此问题,我们提出一种新的评估框架,将LLM仿真置于 established reference模型的动态之内。通过将LLM视为黑箱函数,我们相对于该 reference模型评估其输入输出行为,这允许我们评估其行为的细节方面。我们的结果显示,虽然可能通过工程化提示来近似预期的动态,但这些仿真的质量对特定的提示选择高度敏感。重要的是,仿真甚至对任意变化如细微的措辞变化和空白字符都敏感。这对当前版本的LLM用于有意义的仿真提出了疑问,因为在没有 reference模型的情况下,不可能事先确定看似无关的提示变更对仿真会产生何种影响。

关键词

引用

@article{arxiv.2412.05093,
  title  = {Sense and Sensitivity: Evaluating the simulation of social dynamics via Large Language Models},
  author = {Da Ju and Adina Williams and Brian Karrer and Maximilian Nickel},
  journal= {arXiv preprint arXiv:2412.05093},
  year   = {2024}
}