中文

PIMUMR 原则:确保 LLM 社群行为中的有效性

计算与语言 2026-04-07 v3 计算机与社会

摘要

大型语言模型 (LLM) 越来越多地被部署来模拟人类集体行为,但这些“AI社会”的方法论严谨性仍未得到充分探讨。通过对39项近期研究进行系统审计,我们识别出六项普遍缺陷——代理人轮廓、交互、记忆、控制、无意识和真实性 (PIMMR)。我们的分析表明,89.7%的研究违反至少一条原则,削弱了仿真的有效性。我们演示了前沿LLM在50.8%的情况下正确识别底层社会实验,而61.0%的提示施加了过度控制,导致结果被预先确定。通过再现五个代表性实验(例如电话游戏),我们显示,当强制执行 PIMMUR 原则时,报告的集体现象常常消失或反转,表明许多“涌现”行为是方法论 artifacts 而非真正的社会动态。我们的发现表明,当前的AI仿真可能捕捉到模型特定的偏见,而非人类社会行为的普遍性,引发了将LLM用作人类社会科学代理人的关键性担忧。

关键词

引用

@article{arxiv.2509.18052,
  title  = {The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies},
  author = {Jiaxu Zhou and Jen-tse Huang and Xuhui Zhou and Man Ho Lam and Xintao Wang and Hao Zhu and Wenxuan Wang and Maarten Sap},
  journal= {arXiv preprint arXiv:2509.18052},
  year   = {2026}
}

备注

13 pages, 9 figures, 3 tables; add more papers in our systematic audit (39 in total)