Ape210K:一个大规模且模板丰富的数学应用题数据集
计算与语言
2020-10-12 v2
摘要
自动数学应用题求解近年来引起了越来越多的关注。以往工作使用的评测数据集在规模和多样性方面存在严重局限。在本文中,我们发布了一个名为 Ape210K 的新的大规模且模板丰富的数学应用题数据集。它包含 21 万道中国小学水平的数学题,是最大的公开数据集 Math23K 规模的 9 倍。每道题都包含推导出答案所需的黄金答案和方程。Ape210K 也具有更大的多样性,拥有 5.6 万个模板,是 Math23K 的 25 倍。我们的分析表明,求解 Ape210K 不仅需要自然语言理解,还需要常识知识。我们期望 Ape210K 成为数学应用题求解系统的基准。实验表明,Math23K 数据集上最先进的模型在 Ape210K 上表现糟糕。我们提出了一种复制增强且特征丰富的序列到序列(seq2seq)模型,该模型在 Math23K 数据集上以 3.2% 的优势超越现有模型,并作为 Ape210K 数据集的强基线。我们的基线模型与人类之间仍存在显著差距,呼吁进一步的研究努力。我们在 https://github.com/yuantiku/ape210k 公开提供 Ape210K 数据集。
引用
@article{arxiv.2009.11506,
title = {Ape210K: A Large-Scale and Template-Rich Dataset of Math Word Problems},
author = {Wei Zhao and Mingyue Shang and Yang Liu and Liang Wang and Jingming Liu},
journal= {arXiv preprint arXiv:2009.11506},
year = {2020}
}
备注
We decide to withdraw this paper, since the proposed Ape210K dataset is not going public, the experiments in this paper is meaningless and irreproducible without access to the dataset. Please contact [email protected] if you have any questions