用于缓解求解偏差的无偏数学应用题基准
人工智能
2022-10-10 v1 计算与语言
摘要
本文重新审视了在当前数学应用题(MWP)基准上评估模型时存在的求解偏差。当前求解器存在由有偏数据集和不当训练策略导致的数据偏差与学习偏差。我们的实验证实,MWP 求解器容易被有偏训练数据集所偏置,这些数据集未能覆盖所有 MWP 中每个问题叙述的多样化提问,因此求解器只能学习浅层启发式规则,而非用于理解问题的深层语义。此外,一个 MWP 天然地可由多个等价方程求解,而当前数据集仅将其中一个等价方程作为标准答案,迫使模型去匹配标注的标准答案,而忽略其他等价方程。为此,我们首先引入了一个名为 UnbiasedMWP 的新颖 MWP 数据集,该数据集通过改变我们收集数据中的基础表达式,并人工为其标注相应的多个新问题来构建。然后,为进一步缓解学习偏差,我们提出了一种动态目标选择(DTS)策略,该策略根据当前模型输出与训练中应用交换律得到的候选等价方程之间的最长前缀匹配,动态选择更合适的目标表达式。结果表明,我们的 UnbiasedMWP 相比其原始数据及其他数据集,偏差显著减少,为公平评估求解器的推理能力(而非最近邻匹配)提供了一个有前景的基准。使用我们的 DTS 训练的求解器在多个 MWP 基准上取得了更高的准确率。源代码可在 https://github.com/yangzhch6/UnbiasedMWP 获取。
引用
@article{arxiv.2205.08108,
title = {Unbiased Math Word Problems Benchmark for Mitigating Solving Bias},
author = {Zhicheng Yang and Jinghui Qin and Jiaqi Chen and Xiaodan Liang},
journal= {arXiv preprint arXiv:2205.08108},
year = {2022}
}