量化语言模型数学推理鲁棒性的因果框架
计算与语言
2023-06-09 v3 机器学习
摘要
我们最近见证了语言模型在困难数学推理问题上的若干令人印象深刻的成果。与此同时,这些模型的鲁棒性也受到质疑;近期工作表明,模型在生成解法时可能依赖于问题描述中的浅层模式。基于行为测试的思想,我们提出了一种新颖的框架,其确定了输入中各种因素(例如问题文本的表面形式、操作数与数学运算符)对输出解法的因果效应。通过将行为分析建立在描述直观推理过程的因果图之上,我们从鲁棒性以及对输入空间中直接干预的敏感性角度研究语言模型的行为。我们将该框架应用于数学应用题的测试平台。我们的分析表明,鲁棒性似乎并未作为规模的函数而持续改善,但 GPT-3 Davinci 模型(175B)相较于所有其他 GPT 变体在鲁棒性和敏感性上均取得了显著改进。
引用
@article{arxiv.2210.12023,
title = {A Causal Framework to Quantify the Robustness of Mathematical Reasoning with Language Models},
author = {Alessandro Stolfo and Zhijing Jin and Kumar Shridhar and Bernhard Schölkopf and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2210.12023},
year = {2023}
}
备注
ACL 2023. A shorter version of the paper was accepted at the MATH-AI Workshop at NeurIPS 2022. 15 pages, 8 figures