中文

审计隐藏信息社交推理游戏中的信念条件化 LLM 智能体

多智能体系统 2026-07-12 v1 人工智能

摘要

在隐藏信息多智能体环境中评估 LLM 智能体是困难的:最终结果方差大,且很少能揭示智能体为何做出如此决定。我们在一个 9 人狼人杀环境中对此进行研究,其中智能体在严格的代码级信息隔离下行动,我们构建了一个可审计的框架,该框架维护一个关于隐藏角色的外部信念状态,将信念更新和信念-行动偏差记录为结构化证据,并支持一个防御性的离线改进循环,在任何策略更改之前审查不良案例。在跨越信念禁用、主动信念、内核消融、阵营限制、消耗策略和高负载等 1080 个冻结游戏中,包括一个种子配对的 A0/A1 比较,主动信念条件与显著更好的好人方结果相关:在 200 个种子的 A0/A1 比较中,好人方胜率从 0.205 上升到 0.390(配对 McNemar χ2=16.4\chi^2 = 16.4, p<0.001p < 0.001),且不可逆的毒药错误更少。然而,我们不将此转变归因于信念内容。直接的行动-信念一致性很低(0.21\approx 0.21),并且只将信念给予狼人比只给予好人方更能帮助好人方,这与简单的持有者受益的解释相悖;因此,我们将该效应报告为一种关联,并将其机制视为未解决。贡献在于审计框架本身:它使效应可测量,暴露了低直接行动-信念一致性,用证据拒绝了一个不可靠的强制消耗干预,并将策略效应与负载混淆因素分开。因此,我们将高噪声隐藏信息游戏中的外部信念主要定位为一个可审计的认知基线,它也携带决策相关信号,将不透明的智能体行为转化为可重放的证据,以实现更安全、受控的迭代。

关键词

引用

@article{arxiv.2607.10814,
  title  = {Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games},
  author = {Yuan Gao and Jiangyi Yang and Yao Zhao and Yichi Zhang},
  journal= {arXiv preprint arXiv:2607.10814},
  year   = {2026}
}

备注

29 pages, 8 figures, 3 tables. Preprint