中文

对抗性数学应用题生成

计算与语言 2024-06-18 v3 人工智能

摘要

大型语言模型(LLMs)显著改变了教育格局。由于当前的抄袭检测工具难以跟上LLMs的快速进步,教育界面临着在LLMs存在的情况下评估学生真实问题解决能力的挑战。在这项工作中,我们探索了一种确保公平评估的新范式——生成对抗性示例,这些示例保留了原始问题的结构和难度,但LLMs无法解决。聚焦于数学应用题领域,我们利用抽象语法树结构性地生成对抗性示例,通过仅编辑问题中的数值,使LLMs产生错误答案。我们在各种开源和闭源LLMs上进行了实验,定量和定性地证明了我们的方法显著降低了它们的数学问题解决能力。我们识别了LLMs之间的共同脆弱性,并提出了一种成本效益高的方法来攻击高成本模型。此外,我们进行了自动分析以调查失败原因,进一步揭示了LLMs的局限性。

关键词

引用

@article{arxiv.2402.17916,
  title  = {Adversarial Math Word Problem Generation},
  author = {Roy Xie and Chengxuan Huang and Junlin Wang and Bhuwan Dhingra},
  journal= {arXiv preprint arXiv:2402.17916},
  year   = {2024}
}

备注

Code/data: https://github.com/ruoyuxie/adversarial_mwps_generation