NumGPT:提升生成式预训练模型的数值能力
计算与语言
2021-10-14 v2 机器学习
摘要
现有的生成式预训练语言模型(如 GPT)侧重于对通用文本的语言结构与语义建模。然而,这些模型未考虑数字的数值属性,无法在数值推理任务(如数学应用题与度量估计)上稳健表现。本文提出 NumGPT,一种显式建模文本中数字数值属性的生成式预训练模型。具体而言,其利用基于原型的数字嵌入编码数字的尾数,并利用独立嵌入编码数字的指数。设计了一种数值感知损失函数,将数字整合进 NumGPT 的预训练目标中。我们在四个不同数据集上进行了广泛实验以评估 NumGPT 的数值能力。实验结果表明,NumGPT 在度量估计、数字比较、数学应用题和数量级分类等一系列数值推理任务上优于基线模型(如 GPT 与带 DICE 的 GPT)。我们还进行了消融研究以评估预训练与模型超参数对性能的影响。
引用
@article{arxiv.2109.03137,
title = {NumGPT: Improving Numeracy Ability of Generative Pre-trained Models},
author = {Zhihua Jin and Xin Jiang and Xingbo Wang and Qun Liu and Yong Wang and Xiaozhe Ren and Huamin Qu},
journal= {arXiv preprint arXiv:2109.03137},
year = {2021}
}
备注
8 pages, 3 figures