GSM-SEM:生成语义变体增强的基准与框架
计算与语言
2026-05-27 v2 人工智能
摘要
诸如 GSM8K 等基准是数学推理的流行指标,但排行榜上的提升可能高估了模型的真实能力,因为固定测试集容易被记忆。大多数鲁棒性变体仅应用表层级扰动(改写、重命名、数字替换、干扰项),这些变体基本保持原始事实不变,静态发布版本随时间也可能成为记忆目标。我们提出GSM-SEM,即一种可重复且随机的框架,用于生成语义上多样化的基准变体,语义变异程度显著高于先前方法。GSM-SEM 通过修改实体、属性或关系来扰动问题表述,频繁改变底层事实,要求模型在新情境下重新计算解答,同时约束生成过程保持原始计算/答案不变且近似保持问题难度。GSM-SEM 每次运行均可生成新变体,无需重新标注,降低对静态公共基准的依赖,从而降低记忆偏置。我们将GSM-SEM 应用于 GSM8K 及两套现有变体套件(GSM-Symbolic 和 GSM-Plus),分别生成 GSM8K-SEM、GSM-Symbolic-SEM 和 GSM-Plus-SEM。评估 14 个 SOTA 大语言模型时,我们观察到在语义扰动搭配符号/Plus 变体时表现一致下降(在 GSM-SEM 最严格配置下平均下降率为 28%)。我们公开发布这三套 SEM 变体作为完全经过人类验证的数据集。最后,为演示 GSM-SEM 在 GSM 风格数学问题之外的适用性,我们将其应用于额外的基准,包括 BigBenchHard、LogicBench 和 NLR-BIRD。
引用
@article{arxiv.2605.07053,
title = {GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations},
author = {Jyotika Singh and Fang Tu and Aziza Mirsaidova and Amit Agarwal and Hitesh Laxmichand Patel and Sandip Ghoshal and Miguel Ballesteros and Karan Dua and Yassine Benajiba and Weiyi Sun and Tao Sheng and Graham Horwood and Sujith Ravi and Dan Roth},
journal= {arXiv preprint arXiv:2605.07053},
year = {2026}
}