中文

超越固定基准与最坏情况攻击:语言模型的动态边界评估

人工智能 2026-05-27 v2

摘要

当今对大型语言模型(LLM)的评估依赖于固定基准,这些基准将同一组项目应用于任何模型,从而产生掩盖能力差距的天花板效应和地板效应。我们认为最具信息量的评估信号位于边界处,即在随机采样解码下每个提示的通过概率接近 0.50.5 处,并提出了动态边界评估(DBE),它主动定位每个模型的边界并将其置于全局可比的难度量表上。DBE 提供三个产出物:(i) 一个涵盖安全性、能力和真实性的已校准题库,其每项难度标签在 99 个参考 LLM 上进行了验证;(ii) 技能引导边界搜索(SGBS),这是一种仅使用 API 级别查询访问来为给定目标 LLM 寻找边界项的搜索算法;以及 (iii) 一种评估协议,可将新的 LLM 置于统一的能力量表上,并在目标超出题库覆盖范围时自适应地扩展评估集。我们在涵盖安全性(有害请求拒绝与过度拒绝)、能力(受限指令遵循)和真实性(多轮谄媚抵抗)的四个类别上实例化了 DBE。由此产生的评估覆盖了更广的模型范围且无饱和现象,同时与现有数据集保持兼容。

关键词

引用

@article{arxiv.2605.06213,
  title  = {Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models},
  author = {Haoxiang Wang and Da Yu and Huishuai Zhang},
  journal= {arXiv preprint arXiv:2605.06213},
  year   = {2026}
}

备注

This submission is being withdrawn because it was submitted without the knowledge and authorization of all co-authors. The authors need to resolve this authorship/authorization issue before any public posting