中文

LiveCultureBench:用于动态社交模拟中大型语言模型的多智能体、多文化基准

人工智能 2026-03-03 v1

摘要

大型语言模型(LLM)越来越多地被用作自主智能体,但评估主要关注任务成功,而非文化适当性或评估者可靠性。我们引入LiveCultureBench,一个多文化、动态基准,将LLM嵌入模拟城镇中,评估其在任务完成和遵守社会文化规范方面的表现。该模拟将小城市建模为位置图,拥有具有多样化人口统计和文化轮廓的合成居民。每个episode分配一个居民每日目标,其他居民提供社交背景。基于LLM的验证器生成结构化判断关于规范违反和任务进度,这些判断被聚合为捕获任务-规范权衡和验证器不确定性的指标。使用LiveCultureBench跨模型和文化轮廓,我们研究(i)LLM智能体的跨文化鲁棒性,(ii)它们在有效性与规范敏感性之间的平衡,(iii)LLM作为裁判评估何时可靠用于自动化基准测试,以及何时需要人工监督。

关键词

引用

@article{arxiv.2603.01952,
  title  = {LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations},
  author = {Viet-Thanh Pham and Lizhen Qu and Thuy-Trang Vu and Gholamreza Haffari and Dinh Phung},
  journal= {arXiv preprint arXiv:2603.01952},
  year   = {2026}
}