中文

超越生存:基于人类对齐策略评估 LLM 在社交推理游戏中的表现

计算与语言 2025-10-14 v1

摘要

社交推理游戏如 Werewolf 结合了语言、推理和策略,为研究自然语言和社交智能提供了测试平台。然而,大多数研究将游戏简化为 LLM 自我对弈,导致模板化的语言输出和零星的案例,忽略了社交游戏的丰富性。评估进一步依赖粗糙的指标,如生存时间或主观评分,因为缺乏质量参考数据。为缓解这些问题,我们构建了一个高质量、经人类验证的多模态 Werewolf 数据集,包含超过 100 小时的视频、3240 万字的言语 token 以及 15 种规则变体。基于该数据集,我们提出了一种新颖的策略对齐评估方法,利用获胜派系的策略作为ground truth,分为两个阶段:1) 言语评估,形式为多选式任务,评估模型在社交能力五个维度上是否能采取恰当的立场;2) 决策评估,评估模型的投票选择和对对手角色的推断能力。该框架实现了对模型语言和推理能力的细粒度评估,同时捕捉其生成战略连贯游戏play的能力。我们的实验表明,最先进的 LLM 显示出多样化的表现,其中约有一半低于 0.50,揭示了在欺骗和反事实推理方面的明显差距。我们希望我们的 数据集进一步激发关于语言、推理和多智能体互动的研究。

关键词

引用

@article{arxiv.2510.11389,
  title  = {Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies},
  author = {Zirui Song and Yuan Huang and Junchang Liu and Haozhe Luo and Chenxi Wang and Lang Gao and Zixiang Xu and Mingfei Han and Xiaojun Chang and Xiuying Chen},
  journal= {arXiv preprint arXiv:2510.11389},
  year   = {2025}
}

备注

34 pages, 32figures