中文

AREG:基于对抗资源提取游戏的大语言模型说服与抵抗评估

计算与语言 2026-02-19 v1

摘要

评估大语言模型(LLM)的社交智能能力越来越需要从静态文本生成转向动态、对抗性的交互。我们引入了对抗资源提取游戏(Adversarial Resource Extraction Game, AREG),作为一种基准方法,将说服与抵抗 operationalized 为动态、零和博弈中的多轮财务资源谈判。通过前沿模型的轮流比赛,AREG 能够在单一的交互框架内联合评估进攻性(说服)和防御性(抵抗)能力。我们的分析表明,这些能力呈弱相关性(ρ=0.33\rho = 0.33),且经验上被解耦:强大的说服性能并不可靠地预测强大的抵抗性能,反之亦然。在所有被评估的模型中,抵抗得分均高于说服得分,这表明在对抗性对话环境中存在系统性的防御优势。进一步的语言学分析表明,交互结构在这些结果中起着核心作用。寻求增量承诺的策略与更高的提取成功率相关联,而寻求验证的响应在成功的防御中更常见,尤其是明确的拒绝。综合这些发现表明,LLM 的社交影响力并非单一能力,而是评估框架只关注说服时可能忽略的非对称行为漏洞。

关键词

引用

@article{arxiv.2602.16639,
  title  = {AREG: Adversarial Resource Extraction Game for Evaluating Persuasion and Resistance in Large Language Models},
  author = {Adib Sakhawat and Fardeen Sadab},
  journal= {arXiv preprint arXiv:2602.16639},
  year   = {2026}
}

备注

15 pages, 5 figures, 11 tables. Includes appendix with detailed experimental results and prompts