中文

LUNA:通过数字插件与预训练在Transformers上以数字增强进行语言理解

计算与语言 2023-03-17 v2

摘要

Transformers广泛用于NLP任务。然而,当前利用transformers理解语言的方法暴露出一个弱点:数字理解。在某些场景中数字频繁出现,尤其在表格等半结构化数据中。但当前基于transformer的语言模型处理富数字任务的方法舍弃或丢失了部分数值信息——例如将数字拆分为子词token——导致许多数字相关错误。本文提出LUNA框架,提升基于transformer的语言模型的数值推理与计算能力。借助NumTok与NumBed数字插件,LUNA将每个数字作为整体表示以建模输入。通过包含回归损失与模型蒸馏的数字预训练,LUNA弥合了数字与词表嵌入间的鸿沟。据我们所知,这是首项利用数字插件将数值能力显式注入语言模型的工作。除在玩具任务上评估玩具模型外,我们在三个大规模transformer模型(RoBERTa、BERT、TabBERT)上针对三个不同下游任务(TATQA、TabFact、CrediTrans)评估LUNA,观察到语言模型性能经LUNA持续提升。增强后的模型亦改进了TAT-QA的官方基线(EM:50.15 -> 59.58)并在CrediTrans上取得SOTA性能(F1 = 86.17)。

关键词

引用

@article{arxiv.2212.02691,
  title  = {LUNA: Language Understanding with Number Augmentations on Transformers via Number Plugins and Pre-training},
  author = {Hongwei Han and Jialiang Xu and Mengyu Zhou and Yijia Shao and Shi Han and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2212.02691},
  year   = {2023}
}