用于评估数学应用题求解器的对抗样本
计算与语言
2021-09-14 v1
摘要
标准准确率指标表明,数学应用题(MWP)求解器在基准数据集上已取得高性能。然而,现有 MWP 求解器在多大程度上真正理解语言及其与数字的关系仍不清楚。本文生成对抗攻击以评估最先进 MWP 求解器的鲁棒性。我们提出两种方法——问题重排序与句子改写——来生成对抗攻击。我们在两个基准数据集上对三种神经 MWP 求解器进行了实验。平均而言,我们的攻击方法能够将这些数据集上 MWP 求解器的准确率降低超过 40 个百分点。我们的结果表明,现有 MWP 求解器对问题文本中的语言变化十分敏感。我们通过人工评估验证了所生成对抗样本的有效性与质量。
引用
@article{arxiv.2109.05925,
title = {Adversarial Examples for Evaluating Math Word Problem Solvers},
author = {Vivek Kumar and Rishabh Maheshwary and Vikram Pudi},
journal= {arXiv preprint arXiv:2109.05925},
year = {2021}
}
备注
Accepted at EMNLP Findings 2021