基于生命史叙事的社区治理仿真 LLM 基准测试
计算机与社会
2026-05-25 v1
摘要
有效的社区治理依赖于理解具体居民的想法与需求。最近的研究使用大语言模型(LLMs)模拟人类答复者,提供了一种可扩展、可复现且成本低的研究人类态度与行为的方法。然而,这些研究通常仅以几个人口变量(年龄、性别、收入)为输入,仅模拟一般化的角色类型。这对于社区治理来说不够,因为决策取决于具体居民的观点。我们通过涵盖数据集、基准、算法和系统的完整研究框架来弥合这一差距。数据集包含通过对 92 名城市社区居民进行每次约两个小时的半结构化访谈而收集的约 120 万字符的第一人称叙事,围绕九个社区治理领域组织。基准测试在四种提示策略下测试了 18 种主流 LLM,结果表明加入丰富的生命史轮廓能显著提升信忠度,但这需要更多的输入 token。算法 curriculum-LoRA 是一种参数高效的个人化框架,通过关闭信忠度-成本之间的鸿沟,使其在约 10 倍更低的每调用成本下匹配最强基准的信忠度,并在测试的每个配置中实现 Pareto 优势。该系统将 curriculum-LoRA 集成到闭环政策评估管道中。这些结果使得资源受限的地方政府能够实现个体水平的 LLM 基于居民的模拟,从而在实际部署前系统化地对社区治理决策进行体外评估。
关键词
引用
@article{arxiv.2605.23783,
title = {Benchmarking LLMs for Community Governance Simulation with Life-history Narratives},
author = {Xu Chen and Yuanzi Li and Lei Wang and Nan Lu and Yang Wang and Anding Wang and Lei Shi and Xiaoxing Fu and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2605.23783},
year = {2026}
}