中文

PALM:面向上下文条件生成的自编码与自回归语言模型预训练

计算与语言 2020-09-22 v2

摘要

自监督预训练,如 BERT、MASS 与 BART,已成为自然语言理解与生成的强大技术。现有预训练技术采用自编码和/或自回归目标,通过从带有若干掩码 token 的损坏文本中恢复原始词 token 来训练基于 Transformer 的模型。现有技术的训练目标常与许多语言生成任务(如生成式问答与对话响应生成)的目标不一致,这些任务要求给定上下文产生新文本。本工作提出 PALM,其采用一种新颖方案,在大型无标注语料上联合预训练自编码与自回归语言模型,专为生成上下文条件的新文本而设计。新方案缓解了现有去噪方案在预训练与微调之间引入的不匹配,其中生成不仅仅是重构原始文本。大量实验表明,PALM 在多种语言生成基准上取得新的 SOTA 结果,涵盖生成式问答(在官方 MARCO 排行榜排名第 1)、CNN/DailyMail 与 Gigaword 上的摘要生成、SQuAD 上的问题生成,以及 Cornell Movie Dialogues 上的对话响应生成。

关键词

引用

@article{arxiv.2004.07159,
  title  = {PALM: Pre-training an Autoencoding&Autoregressive Language Model for Context-conditioned Generation},
  author = {Bin Bi and Chenliang Li and Chen Wu and Ming Yan and Wei Wang and Songfang Huang and Fei Huang and Luo Si},
  journal= {arXiv preprint arXiv:2004.07159},
  year   = {2020}
}

备注

Accepted at EMNLP 2020