基于策略梯度的动态提示学习用于半结构化数学推理
机器学习
2023-03-03 v3 人工智能
计算与语言
计算机视觉与模式识别
摘要
数学推理作为人类智能的核心能力,在抽象思维与逻辑推理方面给机器带来了独特挑战。近期,GPT-3等大型预训练语言模型在以文本形式书写的数学推理任务(如数学应用题(MWP))上取得了显著进展。然而,这些模型能否处理涉及异构信息(如表格数据)上数学推理的更复杂问题仍属未知。为填补这一空白,我们提出表格数学应用题(TabMWP),这是一个包含38,431道开放领域年级水平问题的新数据集,需要在文本与表格数据上进行数学推理。TabMWP中的每个问题都对应一个表格上下文,以图像、半结构化文本和结构化表格的形式呈现。问题分为两类:自由文本与多选,且每个问题都标注了揭示多步推理过程的黄金解。我们在TabMWP上评估了不同的预训练模型,包括少样本设置下的GPT-3模型。如前人研究指出,由于少样本GPT-3依赖于上下文示例的选择,其性能不稳定且可能退化至接近随机水平。在处理如TabMWP这类复杂问题时,这一不稳定问题更为严重。为缓解该问题,我们进一步提出一种新方法PromptPG,其利用策略梯度从少量训练数据中学习选择上下文示例,并为测试样本构建相应提示。实验结果表明,我们的方法在准确率指标上优于最佳基线5.31%,且相较于随机选择显著降低了预测方差,验证了其在上下文示例选择上的有效性。
引用
@article{arxiv.2209.14610,
title = {Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning},
author = {Pan Lu and Liang Qiu and Kai-Wei Chang and Ying Nian Wu and Song-Chun Zhu and Tanmay Rajpurohit and Peter Clark and Ashwin Kalyan},
journal= {arXiv preprint arXiv:2209.14610},
year = {2023}
}
备注
ICLR 2023. 26 pages and 18 figures. The data and code are available at https://promptpg.github.io