中文

RIDE:基于项目反应理论且难度可演化的数学推理对抗扰动

计算与语言 2026-02-03 v2

摘要

大型语言模型(LLM)在数学推理上取得了高性能,但这些结果可能因训练数据泄露或表面模式匹配而非真正的推理而被夸大。为此,需要基于对抗扰动的评估来衡量真正的数学推理能力。当前基于规则的扰动方法通常生成病态问题,并阻碍了对问题难度和基准演化的系统评估。为了弥合这一差距,我们提出 RIDE,一种新颖的对抗性问题重写框架,利用项目反应理论(IRT)严格测量问题难度,并生成本质上更具挑战性且良态的数学问题变体。我们使用 35 个 LLM 模拟学生,并根据它们的响应构建难度排序器。该排序器在强化学习期间提供奖励信号,并引导问题重写模型在不同难度级别上重构现有问题。将 RIDE 应用于竞赛级数学基准,生成的扰动版本导致高级 LLM 性能下降,实验表明 26 个模型的平均下降 21.73%,从而暴露了数学推理中有限的鲁棒性,并证实了我们评估方法的有效性。

关键词

引用

@article{arxiv.2511.04120,
  title  = {RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning},
  author = {Xinyuan Li and Murong Xu and Wenbiao Tao and Hanlun Zhu and Yike Zhao and Jipeng Zhang and Yunshi Lan},
  journal= {arXiv preprint arXiv:2511.04120},
  year   = {2026}
}