中文

StressEval:面向大型语言模型知识密集型推理的基于失败驱动的动态基准测试

计算与语言 2026-05-05 v1

摘要

静态基准测试在知识密集型推理任务中日益受到污染和过拟合的影响。虽然最近的动态基准测试可缓解时效性问题,但往往以牺牲可解答性和可控性为代价。本文提出 StressEval,一个基于模型失败驱动的数据合成框架,将观察到的模型失败转化为具有挑战性且可控的测试实例。StressEval 包含三个阶段:首先构建半结构化难度卡片,识别失败的推理步骤及其根本原因;其次应用双视角实例合成方法,针对知识缺口和推理中断,同时保持底层难度因素;最后应用门控机制仅保留受控且无歧义的实例。基于多个知识密集型推理数据集,我们使用 StressEval 构建 Dynamic OneEval,一套聚焦的挑战性动态基准。对于多种前沿大型语言模型,Dynamic OneEval 比原始基准测试产生显著更大的性能下降,同时保留明确的难度因素,实现更具可操作性的迭代。

关键词

引用

@article{arxiv.2605.01939,
  title  = {StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models},
  author = {Yongrui Chen and Yangyang Ma and Xiaoying Huang and Shenyu Zhang and Huajun Chen and Haofen Wang and Guilin Qi},
  journal= {arXiv preprint arXiv:2605.01939},
  year   = {2026}
}

备注

Accepted by IJCAI-2026