中文

掩码测量预测:学习从文本上下文中联合预测数值与单位

计算与语言 2021-12-17 v1 机器学习

摘要

物理测量在学术论文、工程报告和网页表格的数字中占很大比例。现有的基准无法正确评估预训练语言模型在测量方面的数值理解能力,阻碍了新方法的开发及其在数值任务中的应用。为此,我们引入了一项新任务——掩码测量预测(MMP),在该任务中,模型学习在给定掩码文本的情况下重建一个数字及其关联的单位。MMP 既可用于训练具备数值感知的新模型,也可用于评估现有系统的数值理解能力。为了解决这一任务,我们引入了一种新的生成式掩码测量(GeMM)模型,该模型联合学习预测数字及其单位。我们进行了细粒度分析,将我们的模型与各种消融模型和基线模型进行比较。我们使用传统预训练 Transformer 模型(RoBERTa)的线性探测来表明,它们的性能显著低于联合训练的数字-单位模型,突出了这一新任务的难度以及我们提出的预训练方法的优势。我们希望这一框架能加速未来构建更鲁棒的数值推理系统的进程。

关键词

引用

@article{arxiv.2112.08616,
  title  = {Masked Measurement Prediction: Learning to Jointly Predict Quantities and Units from Textual Context},
  author = {Daniel Spokoyny and Ivan Lee and Zhao Jin and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2112.08616},
  year   = {2021}
}

备注

Preprint