中文

高风险群体模拟中语言智能体的隐式行为对齐

计算与语言 2025-09-23 v1 人工智能 计算机与社会

摘要

语言驱动的生成式智能体实现了大规模社会模拟,具有从人际训练到辅助全球政策制定等变革性用途。然而,近期研究表明,生成式智能体的行为往往偏离专家预期和真实世界数据——我们将其称为行为真实性差距。为解决这一问题,我们引入了一个名为 Persona-Environment Behavioral Alignment (PEBA) 的理论框架,将其表述为基于 Lewin 行为方程的分布匹配问题,该方程指出行为是人与其环境的函数。利用 PEBA,我们提出了 PersonaEvolve (PEvo),一种基于 LLM 的优化算法,通过迭代精炼智能体人格,在特定环境背景下隐式地将其集体行为与现实的专家基准对齐。我们在自行开发的一名活跃枪手事件模拟中验证了 PEvo,与无引导相比,分布散度平均降低了 84%,相比显式指令基线提高了 34%。结果还表明,经 PEvo 精炼的人格可泛化至新颖的相关模拟场景。我们的方法极大提升了高风险社会模拟中的行为真实性与可靠性。更广泛地,PEBA-PEvo 框架为开发可信赖的 LLM 驱动的社会模拟提供了一种有原则的方法。

关键词

引用

@article{arxiv.2509.16457,
  title  = {Implicit Behavioral Alignment of Language Agents in High-Stakes Crowd Simulations},
  author = {Yunzhe Wang and Gale M. Lucas and Burcin Becerik-Gerber and Volkan Ustun},
  journal= {arXiv preprint arXiv:2509.16457},
  year   = {2025}
}

备注

Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Main Conference