面向概念中心化常识的文本到文本Transformer预训练
计算与语言
2020-11-26 v2 人工智能
机器学习
摘要
预训练语言模型(PTLM)在一系列自然语言理解(NLU)和生成(NLG)任务中取得了令人瞩目的结果。然而,当前的预训练目标,如掩码词预测(用于BERT风格PTLM)和掩码片段填充(用于T5风格PTLM),并未显式建模关于日常概念的关系型常识知识,而这对于许多需要常识来理解或生成的下游任务至关重要。为用概念中心化常识知识增强PTLM,本文提出从文本中学习常识的生成式与对比式目标,并将其用作增量预训练PTLM(在下游数据集上特定任务微调之前)的中间自监督学习任务。此外,我们开发了一个联合预训练框架以统一生成式与对比式目标,使二者相互强化。大量实验结果表明,我们的方法——概念感知语言模型(CALM)——能够在不依赖外部知识图谱的情况下,将更多常识知识装入预训练文本到文本transformer的参数中,从而在NLU和NLG任务上取得更好性能。我们表明,尽管仅在一个相对小的语料上增量预训练少数步数,CALM仍以稳定优势超越基线方法,甚至可与某些更大的PTLM相媲美,这说明CALM可作为提升PTLM常识推理能力的通用即插即用方法。
引用
@article{arxiv.2011.07956,
title = {Pre-training Text-to-Text Transformers for Concept-centric Common Sense},
author = {Wangchunshu Zhou and Dong-Ho Lee and Ravi Kiran Selvam and Seyeon Lee and Bill Yuchen Lin and Xiang Ren},
journal= {arXiv preprint arXiv:2011.07956},
year = {2020}
}
备注
15 pages, 4 figures. Code and Data: https://github.com/INK-USC/CALM/