中文

面向数学推理的自动化鲁棒性评估

计算与语言 2026-04-27 v2

摘要

大型语言模型(LLMs)在各种推理密集型任务中展现出惊人的能力。然而,这些模型常常在同一底层任务的简单变体中出现意外脆弱性。现有的鲁棒性评估主要依赖手工制作的模板或有限的扰动规则。因此,这些方法缺乏针对特定模型所固有的潜在漏洞的适应性,仍然容易受到数据污染的影响。为此,我们提出Math Stress Tester(MaSTer),一种受软件压力测试启发的自动化框架。MaSTer通过多轮改写-验证循环生成对抗变体,确保语义一致性同时成功诱发模型失效。我们的框架为每个LLM动态生成基准变体,从而最大限地降低数据污染的风险。在GSM8K和MATH-500上的实验表明,MaSTer在数学任务中有效。此外,我们验证了该框架对非数学任务的可扩展性,突显了其广泛适用性。进一步地,我们表明由MaSTer生成的合成变体可用于微调数据集,以显著提升模型的鲁棒性。

关键词

引用

@article{arxiv.2506.05038,
  title  = {Toward Automated Robustness Evaluation of Mathematical Reasoning},
  author = {Yutao Hou and Zeguan Xiao and Fei Yu and Yihan Jiang and Ma Shuguang and Zhaoqian Dai and Hailiang Huang and Yun Chen and Guanhua Chen},
  journal= {arXiv preprint arXiv:2506.05038},
  year   = {2026}
}

备注

Accepted by Findings of ACL2026