中文

CPT:一种面向中文语言理解与生成的非平衡预训练 Transformer

计算与语言 2022-07-19 v4

摘要

在本文中,我们利用已有的预训练模型(PTMs)并提出一种新颖的中文预训练非平衡 Transformer(CPT)。与以往的中文 PTM 不同,CPT 旨在利用自然语言理解(NLU)与自然语言生成(NLG)之间的共享知识来提升性能。CPT 由三部分组成:一个共享编码器、一个理解解码器和一个生成解码器。两个特定的解码器与共享编码器分别通过掩码语言建模(MLM)和去噪自编码(DAE)任务进行预训练。借助部分共享的架构与多任务预训练,CPT 能够(1)通过两个解码器学习 NLU 与 NLG 任务的特定知识,以及(2)灵活微调以充分挖掘模型潜力。此外,非平衡 Transformer 节省了计算与存储开销,使 CPT 具有竞争力并极大加速文本生成的推理。在广泛的中文 NLU 与 NLG 任务上的实验结果证明了 CPT 的有效性。

关键词

引用

@article{arxiv.2109.05729,
  title  = {CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation},
  author = {Yunfan Shao and Zhichao Geng and Yitao Liu and Junqi Dai and Hang Yan and Fei Yang and Li Zhe and Hujun Bao and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2109.05729},
  year   = {2022}
}

备注

Code is available at https://github.com/fastnlp/CPT