评估游戏:超越静态 LLM 基准测试
机器学习
2026-05-20 v1 人工智能
摘要
随着越狱行为(规避安全约束的对抗性输入)在大语言模型中持续被发现,实践者日益依赖微调作为防御策略。然而支撑这种鲁棒性微调的理论基础仍未得到充分探讨。我们引入一种博弈论框架,将评估者(用于检测越狱的审计者)与训练者的互动形式化为双人博弈。我们方法的一个关键特点是使用群作用(group actions),这是一种捕捉对称性和变换的数学结构,用于正式表示数据增强。最简单的非平凡实例是圆环与循环平移群,其中我们展示了根据训练者的泛化范围存在 various régimes。若低于临界阈值,评估者在线性数量的轮次中保持恒定的漏检率,而其他设置则可能产生截然不同的行为。我们进一步提供了实证证据支持模型中局部依赖性:对于我们测试的三个模型族(Llama、Qwen 和 Mistral),我们有显著证据表明,对抗性提示进行微调仅导致局部泛化,测试示例的拒绝率与到微调提示的距离高度相关。我们的框架重新定义了对抗性评估的核心对象:基准测试不是静态的提示集合,而是评估者群作用下的轨道(orbit),而忽略训练者侧适应性的审计协议无法区分真正的修复与记忆性补丁。
引用
@article{arxiv.2605.19377,
title = {The Evaluation Game: Beyond Static LLM Benchmarking},
author = {Paul Wang and Jade Garcia-Bourrée and Anne-Marie Kermarrec and Vincent Corruble},
journal= {arXiv preprint arXiv:2605.19377},
year = {2026}
}
备注
36 pages