中文

熟能生巧:面向数学应用题求解器的数据增强

计算与语言 2022-05-03 v1

摘要

现有的数学应用题(MWP)求解器在基准数据集上已取得了很高的准确率。然而,已有研究表明此类求解器泛化能力不佳,且依赖表面线索来获得高性能。在本文中,我们首先通过实验表明,这种行为主要与现有 MWP 数据集规模有限且多样性不足有关。接着,我们提出了若干数据增强技术,可宽泛地归为基于替换和基于改写的方法。通过部署这些方法,我们将现有数据集的规模扩充至五倍。在三个最先进的 MWP 求解器上、基于两个基准数据集的大量实验表明,所提方法提升了现有求解器的泛化能力与鲁棒性。平均而言,所提方法在基准数据集上将最先进(SOTA)结果显著提升了超过五个百分点。此外,在增强数据集上训练的求解器在挑战性测试集上表现相对更优。我们还通过消融实验展示了所提技术的有效性,并通过人工评估验证了增强样本的质量。

关键词

引用

@article{arxiv.2205.00177,
  title  = {Practice Makes a Solver Perfect: Data Augmentation for Math Word Problem Solvers},
  author = {Vivek Kumar and Rishabh Maheshwary and Vikram Pudi},
  journal= {arXiv preprint arXiv:2205.00177},
  year   = {2022}
}

备注

Accepted at NAACL 2022