中文

从惩和到动态对抗:大语言模型的“ squid game ”评估

计算与语言 2026-02-02 v2 人工智能

摘要

当代大语言模型(LLM)基准测试中潜在的数据污染问题,构成了建立可信评估框架的根本挑战。与此同时,这些基准主要假设惩和、资源丰富的环境,未探讨 LLM 在压力下的行为。本文引入 \textsc{Squid Game},一种具有动态和对抗性的评估环境,设定资源受限且信息不对称,通过交互式游戏对抗其他 LLM 对手来评估 LLM。Squid Game 包含六个淘汰式关卡,聚焦多方面能力,包括指令遵循、代码、推理、计划和安全对齐。我们在 Squid Game 上评估了超过 50 个 LLM,呈现了在动态对抗情景下对通用 LLM 进行规模化行为评估。我们观察到同一模型谱系中表现出现清晰的代际转变,并发现一些模型会求于投机捷径以赢得游戏,暗示静态基准中可能存在更高层次的评估范式污染。我们还比较了主要 LLM 基准与 \textsc{Squid Game},指出动态评估可作为静态评估的补充部分。项目页面: https://github.com/zijianchen98/LLM_Squid_Game。

关键词

引用

@article{arxiv.2511.10691,
  title  = {Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models},
  author = {Zijian Chen and Wenjun Zhang and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2511.10691},
  year   = {2026}
}

备注

31 pages, 15 figures