校准仪器:LLM驱动的合成群体的可控性
多智能体系统
2026-07-01 v1
摘要
生成式合成群体(GSP)——群体合成、基于代理的建模和LLM代理的融合——正引起城市模拟和机构传播研究的日益关注。在任何GSP仪器用于真实群体之前,必须回答一个更基本的问题:它是否以有序、可复制、群体结构化的方式响应已知效价的刺激?我们称之为可控性。我们问的不是合成群体是否追踪人类,而是它是否追踪自身:我们施加在其上的潜在结构是否在其自身响应中被恢复。这个内部效度问题在逻辑上先于任何关于外部效度的声明,就像表征仪器的响应函数必须先于用它来测试理论一样。我们报告了SIVE(合成仪器验证实验):一个虚构的自治市(Montelago),拥有120个已知潜在结构的合成角色,暴露于七种条件,涵盖从强烈正面到强烈负面的关于水管网的机构传播。七个预注册标准,在温度扫描中评估,共同评估保真度、稳定性、噪声底、特异性、敏感性和排序。所有七个标准在每个温度下都通过。一个核心发现将校准失败转化为诊断成功:一个设计为“弱正面”的消息被仪器识别为功能性负面,追溯到其文本中未解决的问题、不确定性和机构被动性;重新设计的版本恢复了预期的排序,并以意想不到的方式与代理的潜在信任互动。一个噪声子实验表明,仪器的固有噪声大约是跨代理估计的一半,并且在不同温度下稳定。个体轨迹揭示了摘要统计所掩盖的连贯微观动态。完整数据可通过交互式探索器获得。
引用
@article{arxiv.2607.00910,
title = {Calibrating the Instrument: Controllability of an LLM-Driven Synthetic Population},
author = {Mirko Degli Esposti},
journal= {arXiv preprint arXiv:2607.00910},
year = {2026}
}